Содержание9
- Зачем проверять сайт на доступность для нейросетей
- Какие боты сканируют сайты и зачем
- Три способа проверить доступность сайта
- Почему сайт может быть заблокирован для ИИ-ботов
- Как открыть доступ: пошаговая настройка
- Что делать после проверки: измеряем результат
- Можно ли запретить ИИ-ботам — и стоит ли
- Частые вопросы
- Источники
Нейросети уже отправляют посетителей на сайты, но большинство владельцев даже не знают, заблокированы их страницы для ИИ-ботов или нет. Проверка занимает десять минут, а исправление — от пары строк в конфиге до серьёзной работы с защитой. Разберём, как убедиться, что ChatGPT, Gemini, Claude и Perplexity видят ваш контент, и что делать, если нет.
Зачем проверять сайт на доступность для нейросетей
Пользователи задают вопросы ChatGPT и получают ответы со ссылками на сайты. Если ваш сайт заблокирован для ботов OpenAI, эти пользователи никогда не узнают о вас. Речь идёт о канале трафика, который растёт быстрее классического поиска, но остаётся невидимым в стандартной аналитике — реферер ИИ-сервисов часто обрезается или пуст.
SEO и GEO-продвижение работают по разным правилам. В SEO важны позиции в выдаче Google или Яндекса. В GEO — упоминания в ответах нейросетей и тексты для сайта, которые цитируют. Share of Voice в ИИ-канале измеряется долей упоминаний вашего домена среди всех ответов по тематическим запросам. Этот показатель не коррелирует с позициями в классическом поиске: сайт на третьей странице Google может доминировать в ответах ChatGPT, если его контент доступен и структурирован.
Сайт, недоступный для GPTBot, не существует для сотен миллионов пользователей ChatGPT — независимо от того, сколько вложено в классическое SEO.
Кто теряет больше всего? B2B-сервисы со сложными запросами — нейросети активно рекомендуют инструменты и подрядчиков. Локальный бизнес теряет запросы вида «где купить / кто сделает в городе N». Контентные проекты лишаются цитирования, которое приносило бы прямой трафик и ссылки.
Какие боты сканируют сайты и зачем
Шесть основных ботов обходят русскоязычные сайты. Они делятся на две группы: обучающие и поисковые. Обучающие боты собирают данные для улучшения моделей. Поисковые — для формирования ответов в реальном времени. Для бизнеса критичнее поисковые: именно они решают, какой сайт попадёт в ответ пользователю прямо сейчас.
| Бот | Компания | Цель обхода | User-Agent | Нужен для GEO |
|---|---|---|---|---|
| GPTBot | OpenAI | Обучение моделей | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.0; +https://openai.com/gptbot) | Частично |
| Claude-Web | Anthropic | Обучение моделей | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Claude-Web/1.0; +https://www.anthropic.com/claude-web) | Частично |
| Google-Extended | Обучение моделей (opt-out) | Google-Extended | Нет — только opt-out | |
| PerplexityBot | Perplexity | Поиск в реальном времени | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://www.perplexity.ai/perplexitybot) | Критично |
| Applebot-Extended | Apple | Apple Intelligence | Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_5) AppleWebKit/605.1.15 (KHTML, like Gecko) Version/13.1.1 Safari/605.1.15 (Applebot/0.1; +http://www.apple.com/go/applebot) | Растущая важность |
| Bingbot + API | Microsoft | Индексация + Copilot | Стандартный Bingbot + специфичные для API | Критично для Copilot |
GPTBot используется для обучения моделей OpenAI. Claude-Web собирает данные для Anthropic. Google-Extended позволяет opt-out из обучения моделей — сам по себе он не приносит трафик, но блокировка других Google-ботов влияет на видимость. PerplexityBot выполняет поиск в реальном времени и напрямую генерирует клики: пользователь видит ссылку и переходит. Applebot-Extended используется для Apple Intelligence — пока аудитория меньше, но растёт в экосистеме iOS и macOS.
Ключевое отличие: обучающие боты посещают сайт раз в недели или месяцы, поисковые — при каждом запросе пользователя. Разблокировка PerplexityBot даст эффект за дни, разблокировка GPTBot — через обновление модели, что занимает недели или месяцы.
Три способа проверить доступность сайта
Онлайн-сервисы проверяют robots.txt и иногда имитируют запрос, но не показывают реальные обходы. Они удобны для быстрой оценки, но не заменяют проверку на живом сервере.
Ручная проверка через curl даёт достоверный результат. Выполните три команды в терминале:
curl -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.0; +https://openai.com/gptbot)" -I https://ваш-сайт.рф/
curl -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://www.perplexity.ai/perplexitybot)" -I https://ваш-сайт.рф/
curl -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Claude-Web/1.0; +https://www.anthropic.com/claude-web)" -I https://ваш-сайт.рф/
Ожидаемый ответ — HTTP 200. Код 403 означает явный запрет, 429 — rate limiting, 503 — блокировку WAF или CDN. Разные коды для разных ботов указывают на фильтрацию по User-Agent.
Проверка через логи сервера надёжнее, но требует доступа к access.log. Ищите строки с этими User-Agent. Внимание: в логах полно фейковых ботов, которые подделывают строку GPTBot для обхода защиты. Отличить реального бота помогает обратный DNS-запрос: IP-адрес OpenAI резолвится в домен *.openai.com, Anthropic — в *.anthropic.com, Perplexity — в *.perplexity.ai. Если IP ведёт на хостинг в Казахстане или Вьетнаме — это подделка.
Почему сайт может быть заблокирован для ИИ-ботов
Четыре механизма блокируют доступ независимо или в комбинации.
| Тип блокировки | Как проверить | Где исправить | Сложность |
|---|---|---|---|
| Явный запрет в robots.txt | Проверить файл на Disallow: для конкретного User-Agent | Корень сайта, файл robots.txt | Низкая |
| Cloudflare: уровень безопасности | Сравнить коды ответа с/без Cloudflare | Панель Cloudflare, Security Level | Средняя |
| WAF-правила по User-Agent | Найти правило в логах WAF | Панель WAF, Custom Rules | Средняя |
| Rate limiting / капча | Проверить логи на 429/503 после серии запросов | Настройки скорости, исключения | Высокая |
| Блокировка по ASN или гео | Проверить IP-адрес бота в чёрных списках | Firewall Rules, IP Access Rules | Высокая |
Ошибочные robots.txt встречаются чаще, чем кажется. Типичный случай: Disallow: / для всех ботов кроме основных поисковых, или забытый Disallow: /api/ без исключения для ИИ-ботов. Проверьте, что ваш файл не содержит User-agent: * с широким запретом — он перекрывает и ИИ-ботов тоже.
Cloudflare может блокировать через WAF, фильтруя по User-Agent. Уровень безопасности «High» или «I'm Under Attack» часто отсекает непроверенных ботов. Проблема: ИИ-боты OpenAI, Anthropic и Perplexity не входят в категории verified bot Cloudflare, хотя и не являются вредоносными. Фильтрация по частоте запросов или геолокации IP тоже затрагивает их.
Как открыть доступ: пошаговая настройка
Правильная конфигурация robots.txt разрешает нужных ботов без открытия всего подряд:
User-agent: GPTBot
Allow: /
User-agent: Claude-Web
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Applebot-Extended
Allow: /
Если нужно закрыть только служебные разделы:
User-agent: GPTBot
Disallow: /admin/
Disallow: /api/internal/
Allow: /
В Cloudflare создайте custom rule вместо глобального снижения security level. Путь: Security -> WAF -> Custom rules -> Create rule. Условие: User Agent contains GPTBot OR Claude-Web OR PerplexityBot OR Applebot-Extended. Действие: Skip -> выбрать WAF Managed Rules, Rate limiting rules, Bot Fight Mode. Не используйте Allow — оно полностью обходит защиту, включая проверку угроз.
Проверка после изменений:
- Повторите curl-запросы — должны вернуться 200
- Проверьте robots.txt через валидатор — отсутствие синтаксических ошибок
- Загляните в логи через пару дней — появились ли реальные обходы
- Проверьте, что другие боты не получили лишний доступ — особенно если использовали широкие исключения
Что делать после проверки: измеряем результат
Разблокировка — только начало. Реальные обходы появятся через разные интервалы: PerplexityBot — довольно быстро, поисковые компоненты Bing и Google — через несколько дней, обучающие выборки крупных моделей — через недели или месяцы, иногда реже.
Ручной мониторинг: составьте список из запросов по вашей тематике и регулярно спрашивайте ChatGPT, Gemini, Perplexity. Фиксируйте: упоминается ли ваш домен, в каком контексте, какая позиция среди рекомендаций. Для локального бизнеса добавьте гео-модификаторы: «где купить... в Новороссийске».
Метрики GEO-продвижения измеряются через Share of Voice по доменам: доля запросов, где ваш сайт упомянут, от общего числа отслеживаемых. Дополнительно — тональность упоминаний и трафик из рефереров ИИ-сервисов в аналитике. Прямой трафик пока невелик, но растёт.
Разблокировали сайт, а в ответах всё ещё нет — нормально. Обучающие модели обновляются редко, а качество контента и авторитетность домена влияют на выбор не меньше, чем техническая доступность.
Без адаптивного сайта с качественным контентом доступность бесполезна: бот увидит страницу, но не найдёт, что цитировать.
Можно ли запретить ИИ-ботам — и стоит ли
Механизмы opt-out существуют, но работают избирательно. Google-Extended позволяет запретить использование контента для обучения моделей Google — через Disallow: Google-Extended в robots.txt. OpenAI предлагает форму opt-out на своём сайте, Anthropic — аналогично. Ни один из этих механизмов не влияет на поисковые ответы: запретили обучение — бот всё равно индексирует для выдачи.
Разница критична: «не обучать на моих данных» и «не показывать в поиске» — разные настройки. Первая контролируется через robots.txt и формы, вторая — только полной блокировкой всех поисковых ботов, что обычно невыгодно.
Практический совет для большинства бизнесов: разрешить доступ выгоднее. Исключения — сайты с уникальными базами данных, которые конкурируют именно контентом, и площадки с юридически чувствительной информацией. Для обычного коммерческого сайта упоминание в ответе ChatGPT или Perplexity — бесплатный трафик и подтверждение экспертизы.
Источники
- Документация GPTBot — OpenAI
- Документация PerplexityBot — Perplexity
- Документация Applebot — Apple
- Документация Cloudflare WAF — Cloudflare