13 мин чтения Продвижение в нейросетях (GEO)

Чем llms-full.txt отличается от llms.txt и нужен ли он сайту

нейросети и ИИ-поиск
Содержание11

llms-full.txt — это один большой markdown, в который склеены материалы из индекса llms.txt. Сам llms.txt — короткая карта канонических страниц; full-версия отдаёт модели весь корпус сразу. Небольшому сайту полный дамп почти не нужен: он занимает контекст, устаревает и может вытащить лишние страницы.

Файлы llms.txt и llms-full.txt: карта и полный текст

llms.txt — короткая markdown-карта канонических страниц в корне сайта. llms-full.txt склеивает материалы из этой карты в один файл, чтобы языковая модель получила корпус сразу. К LMS это не относится.

Learning management system — платформа обучения: курсы, уроки, тесты. LLMs.txt — файлы для моделей. Похожие буквы, разные задачи.

Модели мешает обычная HTML-страница. HTML тащит вёрстку и скрипты. SPA часто отдаёт пустую оболочку: в исходнике нет текста, который можно цитировать. Модель тратит токены на шум.

sitemap.xml даёт список адресов для обхода, но без аннотаций и без приоритета смысла. robots.txt задаёт доступ краулера к URL, а не порядок цитирования.

llms.txt пишется в Markdown и лежит в корне домена. Внутри — название проекта, саммари, ссылки на канонические материалы с пояснениями. Файл задаёт приоритеты для языковой модели: сначала то, что можно цитировать, потом второстепенное. Формат описывает llmstxt.org. Это предложение сообщества, не стандарт IETF или W3C.

llms-full.txt склеивает материалы индекса в один markdown. Модель читает корпус целиком и не обходит сайт по одному адресу. Индекс при этом остаётся картой: склейка его не подменяет.

llms.txt — карта канонических страниц, llms-full.txt — весь корпус в одном файле. К системе обучения LMS это не относится.

Как устроен llms.txt: саммари, секции и Optional

Соберите llms.txt как визитку сайта, а не как выгрузку всех URL. Сверху — заголовок с названием проекта. Следом короткое саммари: одно-два предложения, чем вы занимаетесь.

Дальше свободный абзац: для кого сайт и какие материалы канонические. Затем секции ссылок с аннотациями. Блок Optional — то, что модель может пропустить, если контекста мало.

Фрагмент для вымышленной студии:

# Северный берег

> Сайты и магазины для компаний побережья.

Канонические страницы — услуги и портфолио. Корзина и кабинет в индекс не входят.

## Главное
- [Услуги](https://severnyi-bereg.example/services.md): что делаем и для кого
- [Портфолио](https://severnyi-bereg.example/portfolio.md): выбранные проекты

## Optional
- [Блог](https://severnyi-bereg.example/blog.md): статьи, если останется место

Рядом с HTML держите markdown-версии тех же страниц: чистый текст без вёрстки и скриптов. Модель тогда читает смысл, а не теги и виджеты. В индекс не попадают корзина, фасеты фильтров, личный кабинет, дубли и служебные лендинги.

Пять блоков, которые стоит явно прописать:

  • summary — кто вы и что считать источником
  • канонические URL — страницы, которые можно цитировать
  • Optional — второстепенное, если контекст кончится
  • что не цитировать — корзина, кабинет, черновики, дубли
  • контакты и метаданные — язык сайта и способ связи

Без этих блоков файл превращается в ещё один список ссылок. Тогда он не лучше карты сайта и не помогает модели выбрать, что цитировать.

Что такое llms-full.txt и зачем склеивать корпус

Полный файл берёт страницы из индекса llms.txt и склеивает их в один markdown. Модель не обходит десятки URL: корпус приходит одним ответом. llms-full.txt расходует контекстное окно. Если дамп не влезает или вытесняет вопрос пользователя, ответ становится хуже короткой карты. Это обмен, не обязательная надстройка.

Склейка уместна, когда на сайте обширная документация, база знаний или пачка стабильных статей, и модели нужен ответ без обхода. Лендингу, визитке и каталогу с живыми ценами полный корпус почти не нужен: склеивать нечего, а устареет быстро. Нет хозяина пересборки — full можно не делать.

Чужую открытую документацию иногда проверяют так: запрашивают /llms-full.txt и загружают файл в модель с большим окном. Приём показывает удобство склейки. Он не оправдывает обход чужого robots.txt и не доказывает, что ваш интернет-магазин выиграет от такого же дампа.

Full-файл экономит обход, но тратит контекстное окно целиком. Это обмен, а не апгрейд llms.txt.

Чем llms.txt отличается от robots.txt и sitemap.xml

Четыре файла часто ставят в один ряд — зря. У каждого своя задача. llms.txt не заменяет robots.txt: индекс расставляет приоритеты цитирования, а правила обхода пишет другой файл. sitemap.xml перечисляет URL иначе, чем llms.txt: там адреса без аннотаций для модели.

Файл Задача Типичный объём Кто читает Обязательность Главный риск
llms.txt Карта канонических материалов и приоритеты цитирования Короткий индекс Языковая модель Нет Устаревшие аннотации и мусорные URL
llms-full.txt Весь корпус в одном markdown Полный дамп Языковая модель Нет Контекстное окно, утечки, устаревание
robots.txt Правила обхода Allow и Disallow Набор правил Поисковые и AI-краулеры Нет, нужна для управления обходом Закрыть нужное или открыть лишнее
sitemap.xml Список URL для индексации Перечень адресов Поисковые роботы Нет Дубли без аннотаций для модели

Поисковому боту — robots.txt и sitemap.xml. Языковой модели — llms.txt. Полный корпус отдаёт только llms-full.txt, и не вместо остальных трёх. Это гигиена для моделей, а не замена SEO.

Короткая визитка в индексе полезнее простыни из всех адресов сайта: модели проще выбрать, что цитировать. robots.txt по-прежнему задаёт, какие URL можно обходить. Без него бот может прийти туда, куда вы его не звали, или не прийти туда, куда звали.

Факт. llms.txt не заменяет robots.txt: индекс задаёт приоритеты цитирования, а доступ краулера по-прежнему задаёт robots.txt.

Нужен ли сайту llms-full.txt: чек-лист по типам

Ответ зависит от типа сайта, а не от моды на формат. Лендингу и визитке почти всегда хватает короткого llms.txt. Полный дамп окупается на документации и базе знаний. Магазину с живыми ценами склейка скорее вредна.

Тип сайта llms.txt llms-full.txt Комментарий
Одностраничник Нужен короткий Не нужен Корпус и так одна страница, склейка дублирует главную
Визитка Нужен Не нужен Карты и одной markdown-визитки хватает
Корпоративный сайт Нужен Редко Full только при большой базе знаний
Интернет-магазин / каталог Нужен, без цен и карточек Не нужен Цены и остатки устаревают быстрее склейки
Блог Нужен, вечнозелёные материалы По объёму Склейка — если корпус стабильный и не раздут
SaaS-документация и база знаний Нужен Нужен Основной случай, когда полный файл окупается

Критерии одни: объём стабильного текста, частота смены цен и остатков, есть ли база знаний, цена ошибки устаревшего дампа. Если у вас одностраничный сайт или визитка, полный файл занимает окно и повторяет то, что и так видно с главной.

Интернет-магазин — самый частый случай «нет» для full. Карточки, акции и остатки меняются быстрее, чем вы пересоберёте дамп. Документация продукта — самый частый случай «да»: корпус стабильный, его как раз удобно отдать одним файлом.

Мнение. Если у вас лендинг, визитка или магазин без базы знаний, берите только llms.txt. Полный дамп собирайте, когда корпус стабильный и его реально пересобирать.

Почему полный дамп может навредить

Больше текста не значит лучший ответ. Дамп вытесняет вопрос пользователя и соседние источники из контекстного окна. Модель тогда цитирует простыню, а не то, о чём спросили. Платить токенами за лишний корпус смысла нет, если запрос уже потерялся.

Склейка устаревает в тот день, когда на сайте меняется каноническая страница, а файл — нет. Нужен хозяин пересборки и пометка, когда дамп обновляли. Цены, акции и остатки в склейку не кладут: они сгорят раньше, чем вы заметите рассинхрон.

Отдельный риск — утечки. В дамп легко попадают черновики, /admin, коммерческие предложения, персональные данные и страницы с noindex. Если страница закрыта в robots.txt, её нельзя довезти через llms-full.txt: это обход собственного запрета. robots.txt задаёт доступ краулера; полный файл не должен открывать то, что закрыто для обхода.

Не стройте сниппеты на том, что поисковик проиндексирует llms-full.txt как обычную страницу: такой гарантии вендоры не дают. Сохраняйте UTF-8 и проверьте ответ сервера. Спецификация не фиксирует единственно верный MIME-тип: смотрите, что реально отдаёт ваш хостинг.

Если страница закрыта в robots.txt, её нельзя довезти через llms-full.txt. Это обход собственного запрета.

Как внедрить файлы на Bitrix, Tilda и WordPress

На Bitrix, Tilda, WordPress и самописе шаги одни и те же. Сначала список канонических URL, потом markdown, потом llms.txt в корне. Решение по full — только после чек-листа, не «заодно». Не обещайте заказчику файл «из коробки»: сначала проверьте, что плагин или компонент правда отдаёт /llms.txt из корня.

  1. Соберите канонические URL: услуги, о компании, документация, выбранные проекты.

  2. Сделайте markdown-версии этих страниц без вёрстки и скриптов.

  3. Положите llms.txt в корень домена и проверьте, что адрес открывается без редиректа-ловушки.

  4. По чек-листу решите, нужен ли llms-full.txt. Нет базы знаний — остановитесь.

  5. Проверьте заголовки ответа и кодировку UTF-8 на живом URL.

  6. Просмотрите состав склейки: нет ли кабинета, noindex, черновиков и устаревших цен.

На 1С-Битрикс файл кладут в корень сайта на диске, рядом с robots.txt. Следите, чтобы ЧПУ не перехватывал /llms.txt и /llms-full.txt. На WordPress плагин имеет смысл, только если он правда отдаёт файл из корня: перед установкой откройте репозиторий и проверьте живой пример. На Тильде произвольный файл в корне домена часто не положить без своего хостинга или прокси.

Пересобирайте индекс после смены канонических страниц, а не ради календарной галочки. last-updated в файле помогает человеку и модели понять свежесть, но не заменяет проверку состава. Номер «единственно верного» MIME из чужого блога лучше не копировать: сверьтесь с ответом своего сервера.

Читают ли ChatGPT, Claude и Яндекс эти файлы

В публичной документации GPTBot, ClaudeBot, PerplexityBot, Google-Extended и ботов Яндекса нет прямого указания, что они читают /llms.txt или /llms-full.txt. llms.txt — добровольное предложение с llmstxt.org, не стандарт IETF или W3C. llms-full.txt в самой спецификации не описан: это соглашение, которое подхватили генераторы документации. Пока вендор сам не заявил поддержку, файл нельзя считать рычагом видимости в чате.

Живые адреса чужих llms.txt имеет смысл открывать руками перед тем, как ставить их в пример клиенту. Битую ссылку в статью и в индекс лучше не тащить. Готовых методик, которые доказывают рост цитирования изза файла, нет. Не обещайте заказчику видимость в чат-ботах.

Честный вывод такой. Файл — гигиена для моделей и удобство для людей, которые сами кормят документацию в чат. Это не рычаг классического SEO и не замена robots.txt. Если бот файл не запросил, у вас всё равно остаётся короткая карта сайта на человеческом языке — и это уже польза.

Частые ошибки и план на одну неделю

Типовой вредный набор один: пустой full как копия HTML, дамп «всего сайта», путаница с LMS, открытый дамп при закрытых в robots.txt ботах и файл, который никто не обновляет. Сначала карта. Полный дамп — по чек-листу, не по умолчанию.

  • 01

    Пустой llms-full.txt, который повторяет HTML. Не публикуйте склейку, пока нет markdown-версий канонических страниц.

  • 02

    Дамп всего сайта, включая фасеты и пагинацию. Склеивайте только то, что уже отобрано в llms.txt.

  • 03

    Ожидание, что файл заменит LMS. Learning management system учит людей, LLMs.txt модель не обучает.

  • 04

    AI-краулеры закрыты в robots.txt, а полный дамп открыт. Выровняйте правила: запрещённое для обхода не должно утекать склейкой.

  • 05

    Файл выложили и забыли. Назначьте хозяина пересборки или откажитесь от full.

Минимум без склейки выглядит так. Соберите канонические URL. Выложите llms.txt. По типу сайта решите, нужен ли full. Проверьте кодировку и заголовки. Просмотрите состав, если склейку всё же делаете. На одном llms.txt стоит остановиться, если нет базы знаний, мало стабильного текста, цены скачут или некому пересобирать дамп.

На сайте из одного HTML с водой канон лучше собрать заново. Подойдут тексты для сайта, а не абзацы, вырезанные из вёрстки. Пришлите структуру разделов, если нужно решить, выкладывать ли склейку: разберём состав индекса и скажем, где full только займёт контекст.

Источники

Частые вопросы

Чем llms-full.txt отличается от llms.txt?

llms.txt — короткий markdown-индекс канонических страниц с аннотациями. llms-full.txt склеивает эти материалы в один файл, чтобы модель получила весь корпус сразу, не обходя десятки URL. Индекс можно выложить без full. Наоборот нельзя: склейке не из чего собираться.

Нужен ли llms-full.txt небольшому сайту?

Лендингу, визитке и небольшому корпоративу почти всегда хватает llms.txt. Полный дамп окупается на обширной документации и базе знаний. На коротком сайте он занимает контекст и быстрее устаревает. Сначала карта. Full — только если есть что склеивать и кто будет пересобирать.

Чем llms.txt отличается от robots.txt?

robots.txt задаёт правила обхода: что боту можно запрашивать. llms.txt не запрещает и не разрешает обход — он описывает, какие материалы считать каноническими и в каком порядке их цитировать. Оба файла нужны рядом. Один другой не подменяет.

Читают ли ChatGPT, Claude и Яндекс файл llms-full.txt?

Формат добровольный: llms.txt предложен на llmstxt.org, а llms-full.txt в спецификации даже не описан. Перед выкладкой сверяйте актуальную документацию GPTBot, ClaudeBot, PerplexityBot, Google-Extended и ботов Яндекса. Если чтение файла не заявлено, рассчитывать на него нельзя.

Поделиться
ВКонтакте Telegram MAX

Расскажите о задаче — посчитаем смету

Ответьте на несколько вопросов: что за компания, какие разделы нужны, есть ли тексты и фотографии. Этого хватит, чтобы посчитать смету с фиксированной ценой и сроком — она бесплатна и ни к чему не обязывает.
Написать