GEO: оптимизация под нейросети, AI Search и цитирование в LLM · supporting

Какие источники используют нейросети

Карта источников LLM: обучение vs live retrieval, какие типы документов цитируют и что не работает как «покупка в выборку».

Редакция Seojnik · обновлено · 3 мин чтения

Нейросети не «ходят по сайтам как штатный Googlebot в выдаче». У них два разных контура источников: параметры обучения (застывший корпус) и извлечение в момент ответа (поиск, браузер, RAG, подключённые инструменты). Путать их — главная ошибка GEO. Этот текст фиксирует карту источников. Кластер: GEO / AI Search. Модель выбора в ChatGPT: как ChatGPT выбирает источники. Замер: исследование видимости.

Дата ревизии: 8 сентября 2026. Это схема, а не секретный список доменов OpenAI.

Два контура, которые нельзя смешивать в KPI

Контур Откуда знание Что можно сделать сайту
Обучение / память модели Открытый веб прошлых лет, книги, код, энциклопедии, форумы. Срез по времени. Стать устойчивой сущностью: согласованное имя, повторяемые факты, сторонние упоминания. Нельзя «докупить» попадание в прошлый претренинг.
Live retrieval Поисковый индекс (у разных продуктов — Google, Bing или свой), открытые URL, иногда загруженный файл. Индексация, каноникал, скорость, ясный документ. Без SEO и технического доступа живого URL для цитаты нет.

Типы источников, которые модели воспроизводят чаще

  1. Энциклопедические и справочные страницы — Wikipedia и аналоги. В международных разборах 2026 года Wikipedia стабильно занимает непропорциональную долю цитат ChatGPT. Для бренда это сигнал: ясное определение важнее маркетингового слогана.
  2. Журналистика и earned media — независимый текст, который подтверждает факт. Muck Rack (май 2026) оценивал долю earned media в цитатах AI как доминирующую.
  3. Первоисточники с методикой — таблицы, выборка, дата, ограничения. Это страницы, которые удобно процитировать целиком.
  4. Документация, стандарты, госсайты — для YMYL и норм. Коммерческий лендинг их не заменяет.
  5. Согласованные сторонние профили сущности — Wikidata, карточки организаций, обзоры «лучших в категории», отраслевые рейтинги. Co-citation сильнее биржевой ссылки.
  6. Форумы и UGC — Reddit и аналоги влияют на тон и «народные» ответы, но редко заменяют канон цифры.

Что почти не работает как «источник»

  • Тонкий AI-пересказ чужого гайда без новых данных.
  • Партнёрский подвал из 40 ссылок.
  • Промо-тон: корреляции 2026 года связывают рекламный язык с меньшей цитируемостью.
  • Закрытый JS-контент, который retrieval не читает.
  • Обещание «мы в обучающей выборке», которое нельзя проверить.

Источник для нейросети — это не домен с высоким DR. Это формулировка, которую модели не стыдно повторить, потому что её можно сверить.

Как это ложится на рунет

Русскоязычный корпус в претренинге меньше англоязычного. Для узкого B2B РФ live retrieval и отраслевые СМИ весят относительно больше, чем «надежда, что модель нас запомнила в 2023». Гипотезы и протокол замера — в исследовании видимости. Практика внедрения: как попасть в ответы ChatGPT.

Рабочий вывод для редакции

Стройте два актива: (1) каноническая страница-факт на своём домене, (2) независимые подтверждения. Первое без второго выглядит как реклама. Второе без первого даёт чужую цитату с искажённой цифрой. Коммерческая рамка: GEO-продвижение.

Ограничение. У публики нет полного лога retrieval ChatGPT. Любой «рейтинг доменов, которые использует GPT» без методики — маркетинг. Мы публикуем типы источников и следствия, не фейковый топ-100 .ru.