robots.txt для Google — не «файл в корне», а то, как именно Googlebot выбирает группу правил и что кабинет Search Console показывает по этому файлу. Синтаксис, Disallow со стейджинга и прод-ошибки закрытия CSS разобраны в техническом robots.txt. Хаб качества — Google SEO. Кабинет — Search Console. Здесь чтение файла роботом поиска, не общая спецификация RFC.
Клиент в логах — Googlebot. Очередь захода — сканирование. Лимит обхода — crawl budget. Решение хранить документ — индексация Google. Карта, которую часто указывают директивой Sitemap: — соседний sitemap.xml для Google.
Что отчёт robots.txt в Console показывает
| Статус кабинета | Значит | Не значит |
|---|---|---|
| Получен | Google скачал /robots.txt с хоста свойства |
Правила «правильные» и каталог в индексе |
| Не удалось получить / 5xx | Робот не дочитал файл: таймаут, 5xx, петля редиректа | «Сайт выпал из поиска» как диагноз |
| 404 | Файла нет — для Google это «всё разрешено» | Ошибка индекса. Пустой ответ и 404 — разные вещи |
| Строка Disallow в тестере | Конкретный путь попал под группу User-agent | URL снят из индекса |
Отчёт файла и отчёт «Страницы» — разные множества. Закрытый путь Google может помнить по внешней ссылке и показать URL без сниппета. Открытый путь не обязан попасть в индекс: дубль, каноникал, тонкость. Сверять «robots без ошибок» с покрытием сайта как KPI договора нельзя.
Как Googlebot выбирает группу правил
Google читает файл по группам User-agent, а не «весь текст подряд». Для основного поиска смотрите группу Googlebot. Если её нет — группу *. Картинки, видео, новости и Shopping ходят своими агентами: Googlebot-Image, Googlebot-Video, Googlebot-News, Storebot-Google. Закрыли /uploads/ только для *, а группу картинок оставили пустой — картинки могут обойти запрет, который вы «видели глазами» в общем блоке.
Самая длинная подходящая запись Allow/Disallow побеждает более короткую в той же группе. Порядок строк в файле для Google не приоритет. Crawl-delay робот поиска игнорирует: лимит обхода задаёт сам Google и скорость ответа сервера, не строка в robots. Host и Clean-param — зона Яндекса; в файле «для Google» они ничего не склеивают.
Проверка URL в Search Console показывает, видит ли робот запрет сейчас. Тестер robots в кабинете — черновик против скачанной копии. Расхождение «в репозитории одно, в кабинете другое» почти всегда плагин WordPress или другой хост свойства (www против без www). Живой тест: открыть https://хост-свойства/robots.txt инкогнито и сверить с тем, что отдаёт проверка URL, а не с FTP.
Disallow экономит заходы Googlebot. Он не заменяет noindex и не лечит дубли. Если страница должна уйти из выдачи, сначала оставьте её доступной, поставьте noindex, дождитесь снятия, потом закрывайте краул. Иначе Google может держать URL в индексе по ссылке и не увидеть свежий запрет на самой странице. Слой доступа на всём стеке — техническое SEO.
Типичный сбой на WordPress в ISPmanager: плагин отдаёт robots с одним хостом, свойство Console подтверждено на другом, а /robots.txt редиректит на HTML. Для Google это уже не файл правил. Если PDF из кабинета называют аудитом robots — это статус скачивания, не спрос: смотрите постановку SEO-аудита.
Ограничение. Нет замера «какой процент сайтов РФ закрыт Disallow: / в глазах Google» и не выдумываем. Актуальные имена агентов и лимиты размера файла смотрите в справке Google, не в пересказе плагина. Общий синтаксис и прод-чеклист остаются на техническом URL, чтобы не каннибалить оба H1.
Частые вопросы
Убирает ли Disallow страницу из индекса Google?
Нет. Disallow мешает сканировать. Чтобы снять документ, нужны noindex на доступной странице или инструмент удаления в Search Console. Закрытый URL Google может продолжать показывать по известной ссылке.
Почему в Search Console robots.txt «получен», а каталог не в индексе?
Кабинет подтвердил, что файл скачался. Хранить URL Google не обязан: дубль, каноникал, noindex, тонкость. Смотрите проверку URL и отчёт «Страницы», не статус файла.
Нужна ли отдельная группа User-agent: Googlebot, если есть *?
Нужна, если правила для поиска должны отличаться от картинок, AdsBot или чужих краулеров. Иначе Googlebot возьмёт группу *. Не копируйте один Disallow во все группы «на всякий случай» — так легко закрыть CSS, который нужен для отрисовки.
Понимает ли Google Crawl-delay в robots.txt?
Нет. Строку игнорирует. Чтобы не жечь обход, режьте мусорные шаблоны точечным Disallow, чините 5xx и TTFB, а не ставьте задержку, которую робот поиска не читает.