Google SEO: поиск, качество и AI-выдача

Сканирование сайта Googlebot

Сканирование сайта Googlebot — очередь на загрузку URL: откуда робот узнаёт адрес и почему визит не равен индексу.

Кирилл Бабийчук · обновлено · 3 мин чтения

Сканирование сайта Googlebot — постановка URL в очередь на загрузку и сам заход клиента. Это не индекс и не позиция. Кто именно стучится в лог — Googlebot. Решение хранить документ — индексация Google. Хаб качества — Google SEO. Здесь очередь: откуда робот узнаёт адрес, что его тормозит и почему «просканировали» не значит «показали».

Кабинет очереди и статусов — Search Console. Как устроена витрина — Google Search. Слой доступа на всём стеке — техническое SEO. Файл запретов — robots.txt.

Откуда URL попадает в очередь

Источник Что даёт Чего не даёт
Внутренние ссылки с живых каноникалов Основной путь обнаружения Не гарантирует повторный обход завтра
sitemap.xml Список кандидатов и подсказку lastmod Не заставляет скачать всё и не лечит дубли
Внешние ссылки и редиректы Вход на новый хост или забытый URL Не отменяет Disallow и basic auth
Проверка URL / запрос индексирования Точечный приоритет одного адреса Не пакетный обход каталога
Предыдущие визиты того же шаблона Повторное сканирование уже известных URL Не «сайт целиком каждый день»

Очередь читает конкретный адрес, не «раздел». Карточка, фильтр и пагинация — три объекта. Если шаблон фильтра плодит параметры, робот будет сканировать мусор, пока вы сами не режете доступ. Как Google делит лимит между шаблонами — соседний URL про crawl budget, сюда формулу не тащим.

Что тормозит сканирование на проде

  • Цепочки 301 через www, https и витрину ISPmanager: клиент тратит заход на редирект, не на документ.
  • Медленный TTFB карточки и 5xx пачками: очередь сжимается, повтор откладывается.
  • Disallow на CSS/JS или на весь каталог «со стейджинга».
  • Бесконечные календари, фасеты и поиск по сайту — ловушка обхода, не спрос.
  • Разные хосты без склейки: робот сканирует два сайта, вы смотрите один.

Сканирование отвечает «дошли ли до файла». Индекс отвечает «стоит ли хранить». Лог без проверки URL в Console — половина сцены.

Отчёт «статистика сканирования» в Search Console показывает запросы хоста за дни, не качество документов. Скачок после выкладки карты или релиза шаблона нормален. Падение без ваших правок чаще упирается в ответы сервера, а не в «Google нас разлюбил». Если PDF из кабинета называют аудитом обхода — это график хоста, не спрос: смотрите постановку SEO-аудита.

Last-Modified и If-Modified-Since экономят тело ответа, когда документ не менялся. Они не заменяют каноникал и не лечат тонкий текст. «Менять дату в sitemap каждый день» без правки страницы робот быстро перестаёт уважать. Живой тест из Console ходит отдельным клиентом InspectionTool — это не регулярное сканирование каталога.

Ограничение. Нет таблицы «сколько URL в сутки Google сканирует у типичного сайта РФ» и не выдумываем. Нет процента Seojnik-краула. Сравнение частоты обхода Google и Яндекса без ваших логов — разговор. How-to по кнопкам интерфейса и разбор ловушек обхода — соседние URL, чтобы не каннибалить этот H1.

Частые вопросы

Почему Googlebot сканирует сайт, а страницы нет в индексе?

Скачали и положили в индекс — разные решения. Смотрите проверку URL: дубль, каноникал, noindex, «просканировано — не проиндексировано».

Ускоряет ли sitemap сканирование сайта Googlebot?

Карта помогает обнаружить канонические 200. Она не заставляет обойти фильтры и не отменяет медленный сервер или Disallow.

Нужно ли просить пересканирование всего сайта каждый понедельник?

Нет. Имеет смысл точечный запрос после реальной правки документа, склейки зеркала или снятия запрета. Пакетный спам кнопкой очередь не расширяет.

Одинаково ли сканируют desktop и smartphone Googlebot?

Нет. Это разные клиенты и часто разные шаблоны. Адаптив «только в браузере с кукой» смартфонный робот не дорисует.