NLP в поисковых системах — это слой, который переводит запрос и документ из цепочки слов в оценку «про одно ли это». Он не заменяет ключ как ярлык задачи и не является списком «LSI-слов». Это не то же самое, что сущность в прозе, и не правила AI-черновика.
Хаб кластера — контентное SEO. Как читать топ, а не частотность, — search intent. Почему фольклорный LSI не фактор — LSI: миф и реальность. Информационную архитектуру, topic clusters и topical authority оставляем соседним H1 карты.
Что именно разбирает NLP в выдаче
Поиск сначала находит кандидатов по лексике: токены, словоформы, инвертированный индекс. Для русского это ещё и морфология: «продвижение сайта» и «продвинуть сайт» не обязаны совпасть буква в букву, чтобы попасть в один пул. Затем отдельный слой смотрит на смысл: запрос и документ кладутся в общее пространство представлений и сравниваются уже не как строки, а как векторы.
Дорогой трансформер не гоняют по всему индексу. Публичная картина Google — каскад: лексический отбор, neural matching (представления концептов), затем BERT-подобные модели на узком хвосте кандидатов. У Яндекса та же логика видна в линейке «Палех» → «Королёв» → YATI: сначала заголовок, потом документ целиком, потом трансформер со вниманием к фрагментам.
| Слой | Что делает | Чего от него ждать в тексте |
|---|---|---|
| Лексика и морфология | Токены, формы, индекс | Слово задачи должно быть в документе явно, не «в подтексте» |
| Neural matching / эмбеддинги | Сопоставить концепт запроса и страницы без общего слова | Писать про задачу, а не набивать синонимы в подвал |
| Трансформер на хвосте | Перечитать запрос и документ вместе, учесть порядок и отрицания | Первый экран и заголовки должны отвечать на ту же формулировку, что в сниппете |
| Асессорская шкала | Учит модель угадывать оценку «насколько документ закрывает запрос» | Не путать с рейтингом в SQRG: оценки не ранжируют напрямую |
Отсюда практический вывод: NLP не отменяет посадочную под задачу. Он снижает штраф за другую формулировку той же задачи и повышает штраф за красивый текст про соседнюю. Если топ продаёт тариф, а страница рассказывает «что такое SEO», слой смысла это увидит — даже если в абзаце стоят все слова запроса.
Имена, которые можно произносить вслух
У Google в официальном гиде по ranking systems названы RankBrain, neural matching и BERT. RankBrain (анонс 2015) помогает связать слова с концептами, когда запрос не совпал с документом дословно. Neural matching сопоставляет представления концептов в запросе и на странице. BERT (в Поиске с октября 2019) читает сочетания слов в обе стороны; Google прямо пишет, что системы на BERT участвуют и в извлечении кандидатов, и в ранжировании. MUM (2021) в том же гиде отдельно оговорён: для общего ранжирования его не используют, только для отдельных задач.
У Яндекса публичная веха — YATI, Yet Another Transformer with Improvements, на YaC 2020. Александр Готманов тогда назвал внедрение самым значимым событием поиска за десять лет после Матрикснета и сравнил вклад с «Палехом» и «Королёвым» вместе. Цифра «4–5% падения офлайн-метрики, если выключить все факторы кроме новой модели» — их заявление на конференции, не замер краула Seojnik. Как устроена выдача целиком — Яндекс Поиск; коммерческие сигналы рядом с текстом — на хабе Яндекс SEO.
Имена систем не нужно вставлять в H1 коммерческой посадки. Они здесь как карта слоёв: что именно «понимает язык», а что по-прежнему считает ссылки, клики и полезность документа. Общая схема «как работает SEO» — отдельная страница.
Что меняется в тексте, а что нет
Меняется цена двусмысленности. Отрицание, порядок слов и роль объекта решают, в какой пул попадёт URL. «Как не платить за SEO» и «как платить за SEO» для трансформера — разные задачи, даже если набор лексем почти тот же. Поэтому первый экран должен назвать объект и действие, а не надеяться, что модель «додумает».
Не меняется дисциплина одной задачи на один URL. Кластеризацию запросов по пересечению топа мы уже разобрали отдельно; сюда её не тащим. Не меняется и запрет на списки похожих слов вместо ответа: LSI — метод 1980-х про SVD, не фактор 2026 года. Сущность по-прежнему называют в прозе признаками, а не Q-кодом. Черновик нейросети проверяет редактор, а не «NLP-фактор».
Если цель — заявки с живых посадочных, а не лекция про эмбеддинги, смотрите SEO-продвижение.
Чего не клонировать
Не пересказывайте H1 «Entities в контенте», «LSI», «Ключевые слова в 2026» и «Search intent». Не называйте эту страницу topic clusters, topical authority или информационной архитектурой — эти URL ещё в очереди. Не обещайте «процент понимания текста по краулу Seojnik» и не выдавайте цитату Яндекса про 4–5% за собственный замер. Не сводите NLP к промпту: как писать черновик — соседний кластер AI для SEO.
Частые вопросы
NLP в поиске — это то же самое, что LSI?
Нет. LSI — старый метод разложения матрицы «термин–документ». Современный поиск использует эмбеддинги и трансформеры, которые смотрят на порядок слов и совместный контекст запроса с документом. Список «похожих слов» этот слой не кормит.
Нужно ли писать синонимы, чтобы BERT или YATI «поняли» страницу?
Нет. Нужно закрыть ту же задачу, что в топе, и назвать объект так, чтобы его не склеить с тёзкой. Синоним уместен, если человек его реально говорит; как приём «набить NLP» он вреден.
Заменяет ли NLP ключевые слова?
Нет. Ключ остаётся ярлыком задачи URL. NLP снижает зависимость от дословного совпадения внутри этой задачи и наказывает документ, который словами попал в запрос, а смыслом — в соседнюю.
Это страница про написание текстов нейросетью?
Нет. Здесь — как поиск разбирает язык запроса и документа. Как редакция принимает AI-черновик, разобрано в AI для контента; полезность документа для человека — в Helpful Content.