10 мин чтения Продвижение в нейросетях (GEO)

Как проверить, видят ли ваш сайт нейросети — и что с этим делать

нейросети и ИИ-поиск
Содержание9

Нейросети уже отправляют посетителей на сайты, но большинство владельцев даже не знают, заблокированы их страницы для ИИ-ботов или нет. Проверка занимает десять минут, а исправление — от пары строк в конфиге до серьёзной работы с защитой. Разберём, как убедиться, что ChatGPT, Gemini, Claude и Perplexity видят ваш контент, и что делать, если нет.

Зачем проверять сайт на доступность для нейросетей

Пользователи задают вопросы ChatGPT и получают ответы со ссылками на сайты. Если ваш сайт заблокирован для ботов OpenAI, эти пользователи никогда не узнают о вас. Речь идёт о канале трафика, который растёт быстрее классического поиска, но остаётся невидимым в стандартной аналитике — реферер ИИ-сервисов часто обрезается или пуст.

SEO и GEO-продвижение работают по разным правилам. В SEO важны позиции в выдаче Google или Яндекса. В GEO — упоминания в ответах нейросетей и тексты для сайта, которые цитируют. Share of Voice в ИИ-канале измеряется долей упоминаний вашего домена среди всех ответов по тематическим запросам. Этот показатель не коррелирует с позициями в классическом поиске: сайт на третьей странице Google может доминировать в ответах ChatGPT, если его контент доступен и структурирован.

Сайт, недоступный для GPTBot, не существует для сотен миллионов пользователей ChatGPT — независимо от того, сколько вложено в классическое SEO.

Кто теряет больше всего? B2B-сервисы со сложными запросами — нейросети активно рекомендуют инструменты и подрядчиков. Локальный бизнес теряет запросы вида «где купить / кто сделает в городе N». Контентные проекты лишаются цитирования, которое приносило бы прямой трафик и ссылки.

Какие боты сканируют сайты и зачем

Шесть основных ботов обходят русскоязычные сайты. Они делятся на две группы: обучающие и поисковые. Обучающие боты собирают данные для улучшения моделей. Поисковые — для формирования ответов в реальном времени. Для бизнеса критичнее поисковые: именно они решают, какой сайт попадёт в ответ пользователю прямо сейчас.

Бот Компания Цель обхода User-Agent Нужен для GEO
GPTBot OpenAI Обучение моделей Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.0; +https://openai.com/gptbot) Частично
Claude-Web Anthropic Обучение моделей Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Claude-Web/1.0; +https://www.anthropic.com/claude-web) Частично
Google-Extended Google Обучение моделей (opt-out) Google-Extended Нет — только opt-out
PerplexityBot Perplexity Поиск в реальном времени Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://www.perplexity.ai/perplexitybot) Критично
Applebot-Extended Apple Apple Intelligence Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_5) AppleWebKit/605.1.15 (KHTML, like Gecko) Version/13.1.1 Safari/605.1.15 (Applebot/0.1; +http://www.apple.com/go/applebot) Растущая важность
Bingbot + API Microsoft Индексация + Copilot Стандартный Bingbot + специфичные для API Критично для Copilot

GPTBot используется для обучения моделей OpenAI. Claude-Web собирает данные для Anthropic. Google-Extended позволяет opt-out из обучения моделей — сам по себе он не приносит трафик, но блокировка других Google-ботов влияет на видимость. PerplexityBot выполняет поиск в реальном времени и напрямую генерирует клики: пользователь видит ссылку и переходит. Applebot-Extended используется для Apple Intelligence — пока аудитория меньше, но растёт в экосистеме iOS и macOS.

Ключевое отличие: обучающие боты посещают сайт раз в недели или месяцы, поисковые — при каждом запросе пользователя. Разблокировка PerplexityBot даст эффект за дни, разблокировка GPTBot — через обновление модели, что занимает недели или месяцы.

Три способа проверить доступность сайта

Онлайн-сервисы проверяют robots.txt и иногда имитируют запрос, но не показывают реальные обходы. Они удобны для быстрой оценки, но не заменяют проверку на живом сервере.

Ручная проверка через curl даёт достоверный результат. Выполните три команды в терминале:

curl -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.0; +https://openai.com/gptbot)" -I https://ваш-сайт.рф/
curl -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://www.perplexity.ai/perplexitybot)" -I https://ваш-сайт.рф/
curl -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Claude-Web/1.0; +https://www.anthropic.com/claude-web)" -I https://ваш-сайт.рф/

Ожидаемый ответ — HTTP 200. Код 403 означает явный запрет, 429 — rate limiting, 503 — блокировку WAF или CDN. Разные коды для разных ботов указывают на фильтрацию по User-Agent.

Проверка через логи сервера надёжнее, но требует доступа к access.log. Ищите строки с этими User-Agent. Внимание: в логах полно фейковых ботов, которые подделывают строку GPTBot для обхода защиты. Отличить реального бота помогает обратный DNS-запрос: IP-адрес OpenAI резолвится в домен *.openai.com, Anthropic — в *.anthropic.com, Perplexity — в *.perplexity.ai. Если IP ведёт на хостинг в Казахстане или Вьетнаме — это подделка.

Почему сайт может быть заблокирован для ИИ-ботов

Четыре механизма блокируют доступ независимо или в комбинации.

Тип блокировки Как проверить Где исправить Сложность
Явный запрет в robots.txt Проверить файл на Disallow: для конкретного User-Agent Корень сайта, файл robots.txt Низкая
Cloudflare: уровень безопасности Сравнить коды ответа с/без Cloudflare Панель Cloudflare, Security Level Средняя
WAF-правила по User-Agent Найти правило в логах WAF Панель WAF, Custom Rules Средняя
Rate limiting / капча Проверить логи на 429/503 после серии запросов Настройки скорости, исключения Высокая
Блокировка по ASN или гео Проверить IP-адрес бота в чёрных списках Firewall Rules, IP Access Rules Высокая

Ошибочные robots.txt встречаются чаще, чем кажется. Типичный случай: Disallow: / для всех ботов кроме основных поисковых, или забытый Disallow: /api/ без исключения для ИИ-ботов. Проверьте, что ваш файл не содержит User-agent: * с широким запретом — он перекрывает и ИИ-ботов тоже.

Cloudflare может блокировать через WAF, фильтруя по User-Agent. Уровень безопасности «High» или «I'm Under Attack» часто отсекает непроверенных ботов. Проблема: ИИ-боты OpenAI, Anthropic и Perplexity не входят в категории verified bot Cloudflare, хотя и не являются вредоносными. Фильтрация по частоте запросов или геолокации IP тоже затрагивает их.

Как открыть доступ: пошаговая настройка

Правильная конфигурация robots.txt разрешает нужных ботов без открытия всего подряд:

User-agent: GPTBot
Allow: /

User-agent: Claude-Web
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Applebot-Extended
Allow: /

Если нужно закрыть только служебные разделы:

User-agent: GPTBot
Disallow: /admin/
Disallow: /api/internal/
Allow: /

В Cloudflare создайте custom rule вместо глобального снижения security level. Путь: Security -> WAF -> Custom rules -> Create rule. Условие: User Agent contains GPTBot OR Claude-Web OR PerplexityBot OR Applebot-Extended. Действие: Skip -> выбрать WAF Managed Rules, Rate limiting rules, Bot Fight Mode. Не используйте Allow — оно полностью обходит защиту, включая проверку угроз.

Проверка после изменений:

  • Повторите curl-запросы — должны вернуться 200
  • Проверьте robots.txt через валидатор — отсутствие синтаксических ошибок
  • Загляните в логи через пару дней — появились ли реальные обходы
  • Проверьте, что другие боты не получили лишний доступ — особенно если использовали широкие исключения

Что делать после проверки: измеряем результат

Разблокировка — только начало. Реальные обходы появятся через разные интервалы: PerplexityBot — довольно быстро, поисковые компоненты Bing и Google — через несколько дней, обучающие выборки крупных моделей — через недели или месяцы, иногда реже.

Ручной мониторинг: составьте список из запросов по вашей тематике и регулярно спрашивайте ChatGPT, Gemini, Perplexity. Фиксируйте: упоминается ли ваш домен, в каком контексте, какая позиция среди рекомендаций. Для локального бизнеса добавьте гео-модификаторы: «где купить... в Новороссийске».

Метрики GEO-продвижения измеряются через Share of Voice по доменам: доля запросов, где ваш сайт упомянут, от общего числа отслеживаемых. Дополнительно — тональность упоминаний и трафик из рефереров ИИ-сервисов в аналитике. Прямой трафик пока невелик, но растёт.

Разблокировали сайт, а в ответах всё ещё нет — нормально. Обучающие модели обновляются редко, а качество контента и авторитетность домена влияют на выбор не меньше, чем техническая доступность.

Без адаптивного сайта с качественным контентом доступность бесполезна: бот увидит страницу, но не найдёт, что цитировать.

Можно ли запретить ИИ-ботам — и стоит ли

Механизмы opt-out существуют, но работают избирательно. Google-Extended позволяет запретить использование контента для обучения моделей Google — через Disallow: Google-Extended в robots.txt. OpenAI предлагает форму opt-out на своём сайте, Anthropic — аналогично. Ни один из этих механизмов не влияет на поисковые ответы: запретили обучение — бот всё равно индексирует для выдачи.

Разница критична: «не обучать на моих данных» и «не показывать в поиске» — разные настройки. Первая контролируется через robots.txt и формы, вторая — только полной блокировкой всех поисковых ботов, что обычно невыгодно.

Практический совет для большинства бизнесов: разрешить доступ выгоднее. Исключения — сайты с уникальными базами данных, которые конкурируют именно контентом, и площадки с юридически чувствительной информацией. Для обычного коммерческого сайта упоминание в ответе ChatGPT или Perplexity — бесплатный трафик и подтверждение экспертизы.

Источники

Частые вопросы

Как проверить, видит ли мой сайт ChatGPT?

Выполните запрос curl с User-Agent GPTBot к главной странице: если ответ HTTP 200 — технически доступен. Затем проверьте robots.txt на наличие Disallow для GPTBot и поищите реальные обращения в access.log сервера.

Сколько времени нужно, чтобы сайт появился в ответах нейросетей после разблокировки?

От нескольких дней до нескольких месяцев в зависимости от платформы. Perplexity и поисковые боты обновляются быстрее, обучающие выборки крупных моделей — реже, иногда раз в квартал.

Cloudflare блокирует ИИ-ботов — как это исправить?

Создайте custom rule в WAF с действием Skip для verified AI-ботов или конкретных User-Agent. Не понижайте глобальный Security Level — это откроет доступ всем, включая вредоносных ботов.

Можно ли запретить OpenAI использовать тексты моего сайта для обучения?

Да — через disallow GPTBot в robots.txt или форму opt-out на сайте OpenAI. Но это блокирует только обучение, не поисковые ответы. Для полного исключения из ответов нужно блокировать все поисковые боты, что обычно невыгодно бизнесу.

Поделиться
ВКонтакте Telegram MAX
Запросить Бриф на e-mail Уже есть концепция?
Запросите бриф на проект, чтобы мы могли объективно просчитать стоимость Вашего будущего проекта.
Нужна консультация?
Мы постараемся ответить на все ваши вопросы

Расскажите о задаче — посчитаем смету

Ответьте на несколько вопросов: что за компания, какие разделы нужны, есть ли тексты и фотографии. Этого хватит, чтобы посчитать смету с фиксированной ценой и сроком — она бесплатна и ни к чему не обязывает.
Написать