Нейросети не «ходят по сайтам как штатный Googlebot в выдаче». У них два разных контура источников: параметры обучения (застывший корпус) и извлечение в момент ответа (поиск, браузер, RAG, подключённые инструменты). Путать их — главная ошибка GEO. Этот текст фиксирует карту источников. Кластер: GEO / AI Search. Модель выбора в ChatGPT: как ChatGPT выбирает источники. Замер: исследование видимости.
Дата ревизии: 8 сентября 2026. Это схема, а не секретный список доменов OpenAI.
Два контура, которые нельзя смешивать в KPI
| Контур | Откуда знание | Что можно сделать сайту |
|---|---|---|
| Обучение / память модели | Открытый веб прошлых лет, книги, код, энциклопедии, форумы. Срез по времени. | Стать устойчивой сущностью: согласованное имя, повторяемые факты, сторонние упоминания. Нельзя «докупить» попадание в прошлый претренинг. |
| Live retrieval | Поисковый индекс (у разных продуктов — Google, Bing или свой), открытые URL, иногда загруженный файл. | Индексация, каноникал, скорость, ясный документ. Без SEO и технического доступа живого URL для цитаты нет. |
Типы источников, которые модели воспроизводят чаще
- Энциклопедические и справочные страницы — Wikipedia и аналоги. В международных разборах 2026 года Wikipedia стабильно занимает непропорциональную долю цитат ChatGPT. Для бренда это сигнал: ясное определение важнее маркетингового слогана.
- Журналистика и earned media — независимый текст, который подтверждает факт. Muck Rack (май 2026) оценивал долю earned media в цитатах AI как доминирующую.
- Первоисточники с методикой — таблицы, выборка, дата, ограничения. Это страницы, которые удобно процитировать целиком.
- Документация, стандарты, госсайты — для YMYL и норм. Коммерческий лендинг их не заменяет.
- Согласованные сторонние профили сущности — Wikidata, карточки организаций, обзоры «лучших в категории», отраслевые рейтинги. Co-citation сильнее биржевой ссылки.
- Форумы и UGC — Reddit и аналоги влияют на тон и «народные» ответы, но редко заменяют канон цифры.
Что почти не работает как «источник»
- Тонкий AI-пересказ чужого гайда без новых данных.
- Партнёрский подвал из 40 ссылок.
- Промо-тон: корреляции 2026 года связывают рекламный язык с меньшей цитируемостью.
- Закрытый JS-контент, который retrieval не читает.
- Обещание «мы в обучающей выборке», которое нельзя проверить.
Источник для нейросети — это не домен с высоким DR. Это формулировка, которую модели не стыдно повторить, потому что её можно сверить.
Как это ложится на рунет
Русскоязычный корпус в претренинге меньше англоязычного. Для узкого B2B РФ live retrieval и отраслевые СМИ весят относительно больше, чем «надежда, что модель нас запомнила в 2023». Гипотезы и протокол замера — в исследовании видимости. Практика внедрения: как попасть в ответы ChatGPT.
Рабочий вывод для редакции
Стройте два актива: (1) каноническая страница-факт на своём домене, (2) независимые подтверждения. Первое без второго выглядит как реклама. Второе без первого даёт чужую цитату с искажённой цифрой. Коммерческая рамка: GEO-продвижение.