Google SEO: поиск, качество и AI-выдача

Googlebot

Googlebot — клиент в логах, не индекс: какие User-agent зачем ходят и почему визит не равен странице в поиске.

Кирилл Бабийчук · обновлено · 4 мин чтения

Googlebot — HTTP-клиент, который скачивает URL для поиска Google. Это не индекс и не позиция. Решение «хранить документ» лежит на индексации; очередь и исключения смотрите в Search Console. Хаб качества и апдейтов — Google SEO. Здесь сам агент в логах: какой User-agent, зачем он пришёл и почему визит не равен «странице в выдаче».

Периметр Яндекса другой: клиент, кабинет и правила доступа разобраны в роботе Яндекса. Складывать двух ботов в один KPI нельзя. Как устроена витрина — Google Search. Слой доступа на всём стеке — техническое SEO.

Какие клиенты ходят и зачем

Агент (фрагмент) Задача Не путать с
Googlebot (desktop / smartphone) Основной обход HTML для поиска «Бот был» ≠ страница в индексе
Googlebot-Image / Video / News Картинки, ролики, новости Закрытый /uploads/ в robots — дыра именно здесь
Storebot-Google Карточки и наличие для Shopping Не замена обычного поискового обхода
Google-InspectionTool Живой тест из Search Console, не регулярный краул каталога Пик после кнопки «проверка URL»
AdsBot-Google Качество посадочных для рекламы Строка в access.log не доказывает интерес Поиска
GoogleOther и служебные выборки Исследовательские и вспомогательные заходы Не «нас продвигают»

Официальные подписи и диапазоны Google публикует сам. Проверяйте User-agent плюс происхождение IP, а не «в логе написано Googlebot». Подделки с этим именем обычны на парсерах выдачи и чужих краулерах.

Как убедиться, что это настоящий Googlebot

Имя в заголовке подделать дёшево. Рабочая проверка — обратный DNS на IP из лога: имя должно оканчиваться на .googlebot.com или .google.com, затем прямой DNS того имени должен вернуть тот же IP. Если обратное имя чужое или прямое не сходится — это не Googlebot, сколько бы он ни писал в User-agent.

Не баните диапазоны «на глаз» по стране датацентра: Google ходит с разных сетей, а ложный блок выглядит как «пропал индекс» без апдейта. Сначала сверка DNS, потом robots.txt и файрвол. Как читать сам файл — robots.txt.

Что видно в access.log и чего там нет

  • Код ответа, который получил робот: ваш 301 на www, 200 в браузере с кукой и 404 без неё — разные объекты.
  • Тип клиента: smartphone-Googlebot и desktop обходят разные шаблоны. Адаптив «только в браузере» робот не дорисует.
  • Частота на шаблон, не на «сайт»: карточку обойдут иначе, чем фильтр. Очередь читает URL.
  • Пик после выкладки sitemap не обещает индекс. Карта предлагает кандидатов, решение — отдельно.
  • Молчание по разделу: Disallow, basic auth, гео-бан, другое зеркало, другой хост.

Googlebot отвечает на вопрос «скачали ли». Search Console — «что решили после». Лог без кабинета — половина сцены.

Главное зеркало, www и https робот обходит как отдельные хосты, пока склейка не устоялась. Ответ 200 на оба — два документа в очереди, не «он сам догадается». Для магазина важнее стабильный TTFB шаблона карточки, чем «ускорить Googlebot» плагином. Если задача — заявки, а не строка в логе, смотрите постановку SEO-аудита.

Ограничение. Цифр «бюджет обхода Google в процентах по РФ» у нас нет и не выдумываем. Как Google делит crawl budget между шаблонами — соседний URL кластера, сюда формулу не тащим. Сравнение «кто чаще ходит, Google или Яндекс» без ваших логов — разговор, не методика. How-to по кликам интерфейса Console на этот H1 не кладём.

Частые вопросы

Почему Googlebot ходит, а страницы нет в поиске?

Скачали и положили в индекс — разные решения. Смотрите проверку URL в Search Console: дубль, каноникал, noindex, soft 404, «обнаружено — не проиндексировано».

Как отличить настоящий Googlebot от парсера?

Сверьте IP обратным и прямым DNS на домены Google. Имя в User-agent подделать дёшево; совпадение PTR и A-записи — нет.

Нужно ли пускать всех роботов Google?

Поисковому Googlebot — да, если URL должен быть кандидатом в индекс. Рекламные и медиа-клиенты режьте точечно, не одним Disallow: /.

Заменяет ли визит Googlebot проверку URL в Search Console?

Нет. Лог говорит, что клиент скачал адрес. Карточка Console говорит, что Google уже положил в индекс и что видит живой тест сейчас.