Ревизия: 8 сентября 2026. robots.txt — это не «файл, который поднимает позиции». Это инструкция краулеру: куда ходить, куда не ходить. Ломается доступ — ломается индекс. Рамка: техническое SEO. Как робот Google вообще видит сайт: Google SEO.
Что файл умеет и чего не умеет
| Задача | robots.txt | Правильный инструмент |
|---|---|---|
| Не тратить краул на корзину, поиск, фильтры | Да, Disallow на мусорные URL | — |
| Убрать страницу из индекса | Нет. Disallow прячет URL от сканирования, не даёт гарантии noindex | noindex / снятие из Search Console |
| Передать каноникал | Нет | rel=canonical |
| Подсказать карту сайта | Да, директива Sitemap: | Плюс отправка в Search Console / Вебмастер |
| Crawl-delay | Google её игнорирует | Лимиты в Search Console, нормальный TTFB |
Рабочие правила для продакшена
- Один файл в корне на протокол и хост, который реально открывается как
/robots.txt. Редирект на другую схему ломает чтение. - Не закрывать CSS и JS, без которых Google не соберёт страницу. Это старая и всё ещё живая ошибка.
- Не ставить
Disallow: /на проде «на всякий случай». Это выключение сайта для поиска. - Служебные параметры и фасеты — закрывать точечно, не весь каталог.
- После правки — проверка URL в Search Console / Вебмастере, не «кажется, робот понял».
robots.txt экономит бюджет обхода. Он не лечит тонкий контент и не заменяет SEO спроса.
Типичные поломки
- На проде остался Disallow с стейджинга.
- Закрыт
/wp-admin— нормально; закрыт/wp-content/themesцеликом — часто вредно для CSS. - Sitemap указан на зеркало без каноникала.
- Разные файлы на www и без www.
Если страница должна остаться в выдаче, но вы закрыли её в robots.txt, бот может помнить старый URL и не увидеть свежий noindex. Сначала доступ, потом директивы индекса. Для нейросетей живой URL всё равно нужен: GEO не отменяет файл роботов.
/robots.txt с продакшена.