Googlebot — HTTP-клиент, который скачивает URL для поиска Google. Это не индекс и не позиция. Решение «хранить документ» лежит на индексации; очередь и исключения смотрите в Search Console. Хаб качества и апдейтов — Google SEO. Здесь сам агент в логах: какой User-agent, зачем он пришёл и почему визит не равен «странице в выдаче».
Периметр Яндекса другой: клиент, кабинет и правила доступа разобраны в роботе Яндекса. Складывать двух ботов в один KPI нельзя. Как устроена витрина — Google Search. Слой доступа на всём стеке — техническое SEO.
Какие клиенты ходят и зачем
| Агент (фрагмент) | Задача | Не путать с |
|---|---|---|
| Googlebot (desktop / smartphone) | Основной обход HTML для поиска | «Бот был» ≠ страница в индексе |
| Googlebot-Image / Video / News | Картинки, ролики, новости | Закрытый /uploads/ в robots — дыра именно здесь |
| Storebot-Google | Карточки и наличие для Shopping | Не замена обычного поискового обхода |
| Google-InspectionTool | Живой тест из Search Console, не регулярный краул каталога | Пик после кнопки «проверка URL» |
| AdsBot-Google | Качество посадочных для рекламы | Строка в access.log не доказывает интерес Поиска |
| GoogleOther и служебные выборки | Исследовательские и вспомогательные заходы | Не «нас продвигают» |
Официальные подписи и диапазоны Google публикует сам. Проверяйте User-agent плюс происхождение IP, а не «в логе написано Googlebot». Подделки с этим именем обычны на парсерах выдачи и чужих краулерах.
Как убедиться, что это настоящий Googlebot
Имя в заголовке подделать дёшево. Рабочая проверка — обратный DNS на IP из лога: имя должно оканчиваться на .googlebot.com или .google.com, затем прямой DNS того имени должен вернуть тот же IP. Если обратное имя чужое или прямое не сходится — это не Googlebot, сколько бы он ни писал в User-agent.
Не баните диапазоны «на глаз» по стране датацентра: Google ходит с разных сетей, а ложный блок выглядит как «пропал индекс» без апдейта. Сначала сверка DNS, потом robots.txt и файрвол. Как читать сам файл — robots.txt.
Что видно в access.log и чего там нет
- Код ответа, который получил робот: ваш 301 на www, 200 в браузере с кукой и 404 без неё — разные объекты.
- Тип клиента: smartphone-Googlebot и desktop обходят разные шаблоны. Адаптив «только в браузере» робот не дорисует.
- Частота на шаблон, не на «сайт»: карточку обойдут иначе, чем фильтр. Очередь читает URL.
- Пик после выкладки sitemap не обещает индекс. Карта предлагает кандидатов, решение — отдельно.
- Молчание по разделу: Disallow, basic auth, гео-бан, другое зеркало, другой хост.
Googlebot отвечает на вопрос «скачали ли». Search Console — «что решили после». Лог без кабинета — половина сцены.
Главное зеркало, www и https робот обходит как отдельные хосты, пока склейка не устоялась. Ответ 200 на оба — два документа в очереди, не «он сам догадается». Для магазина важнее стабильный TTFB шаблона карточки, чем «ускорить Googlebot» плагином. Если задача — заявки, а не строка в логе, смотрите постановку SEO-аудита.
Ограничение. Цифр «бюджет обхода Google в процентах по РФ» у нас нет и не выдумываем. Как Google делит crawl budget между шаблонами — соседний URL кластера, сюда формулу не тащим. Сравнение «кто чаще ходит, Google или Яндекс» без ваших логов — разговор, не методика. How-to по кликам интерфейса Console на этот H1 не кладём.
Частые вопросы
Почему Googlebot ходит, а страницы нет в поиске?
Скачали и положили в индекс — разные решения. Смотрите проверку URL в Search Console: дубль, каноникал, noindex, soft 404, «обнаружено — не проиндексировано».
Как отличить настоящий Googlebot от парсера?
Сверьте IP обратным и прямым DNS на домены Google. Имя в User-agent подделать дёшево; совпадение PTR и A-записи — нет.
Нужно ли пускать всех роботов Google?
Поисковому Googlebot — да, если URL должен быть кандидатом в индекс. Рекламные и медиа-клиенты режьте точечно, не одним Disallow: /.
Заменяет ли визит Googlebot проверку URL в Search Console?
Нет. Лог говорит, что клиент скачал адрес. Карточка Console говорит, что Google уже положил в индекс и что видит живой тест сейчас.