Содержание11
- Файлы llms.txt и llms-full.txt: карта и полный текст
- Как устроен llms.txt: саммари, секции и Optional
- Что такое llms-full.txt и зачем склеивать корпус
- Чем llms.txt отличается от robots.txt и sitemap.xml
- Нужен ли сайту llms-full.txt: чек-лист по типам
- Почему полный дамп может навредить
- Как внедрить файлы на Bitrix, Tilda и WordPress
- Читают ли ChatGPT, Claude и Яндекс эти файлы
- Частые ошибки и план на одну неделю
- Частые вопросы
- Источники
llms-full.txt — это один большой markdown, в который склеены материалы из индекса llms.txt. Сам llms.txt — короткая карта канонических страниц; full-версия отдаёт модели весь корпус сразу. Небольшому сайту полный дамп почти не нужен: он занимает контекст, устаревает и может вытащить лишние страницы.
Файлы llms.txt и llms-full.txt: карта и полный текст
llms.txt — короткая markdown-карта канонических страниц в корне сайта. llms-full.txt склеивает материалы из этой карты в один файл, чтобы языковая модель получила корпус сразу. К LMS это не относится.
Learning management system — платформа обучения: курсы, уроки, тесты. LLMs.txt — файлы для моделей. Похожие буквы, разные задачи.
Модели мешает обычная HTML-страница. HTML тащит вёрстку и скрипты. SPA часто отдаёт пустую оболочку: в исходнике нет текста, который можно цитировать. Модель тратит токены на шум.
sitemap.xml даёт список адресов для обхода, но без аннотаций и без приоритета смысла. robots.txt задаёт доступ краулера к URL, а не порядок цитирования.
llms.txt пишется в Markdown и лежит в корне домена. Внутри — название проекта, саммари, ссылки на канонические материалы с пояснениями. Файл задаёт приоритеты для языковой модели: сначала то, что можно цитировать, потом второстепенное. Формат описывает llmstxt.org. Это предложение сообщества, не стандарт IETF или W3C.
llms-full.txt склеивает материалы индекса в один markdown. Модель читает корпус целиком и не обходит сайт по одному адресу. Индекс при этом остаётся картой: склейка его не подменяет.
llms.txt — карта канонических страниц, llms-full.txt — весь корпус в одном файле. К системе обучения LMS это не относится.
Как устроен llms.txt: саммари, секции и Optional
Соберите llms.txt как визитку сайта, а не как выгрузку всех URL. Сверху — заголовок с названием проекта. Следом короткое саммари: одно-два предложения, чем вы занимаетесь.
Дальше свободный абзац: для кого сайт и какие материалы канонические. Затем секции ссылок с аннотациями. Блок Optional — то, что модель может пропустить, если контекста мало.
Фрагмент для вымышленной студии:
# Северный берег
> Сайты и магазины для компаний побережья.
Канонические страницы — услуги и портфолио. Корзина и кабинет в индекс не входят.
## Главное
- [Услуги](https://severnyi-bereg.example/services.md): что делаем и для кого
- [Портфолио](https://severnyi-bereg.example/portfolio.md): выбранные проекты
## Optional
- [Блог](https://severnyi-bereg.example/blog.md): статьи, если останется место
Рядом с HTML держите markdown-версии тех же страниц: чистый текст без вёрстки и скриптов. Модель тогда читает смысл, а не теги и виджеты. В индекс не попадают корзина, фасеты фильтров, личный кабинет, дубли и служебные лендинги.
Пять блоков, которые стоит явно прописать:
- summary — кто вы и что считать источником
- канонические URL — страницы, которые можно цитировать
- Optional — второстепенное, если контекст кончится
- что не цитировать — корзина, кабинет, черновики, дубли
- контакты и метаданные — язык сайта и способ связи
Без этих блоков файл превращается в ещё один список ссылок. Тогда он не лучше карты сайта и не помогает модели выбрать, что цитировать.
Что такое llms-full.txt и зачем склеивать корпус
Полный файл берёт страницы из индекса llms.txt и склеивает их в один markdown. Модель не обходит десятки URL: корпус приходит одним ответом. llms-full.txt расходует контекстное окно. Если дамп не влезает или вытесняет вопрос пользователя, ответ становится хуже короткой карты. Это обмен, не обязательная надстройка.
Склейка уместна, когда на сайте обширная документация, база знаний или пачка стабильных статей, и модели нужен ответ без обхода. Лендингу, визитке и каталогу с живыми ценами полный корпус почти не нужен: склеивать нечего, а устареет быстро. Нет хозяина пересборки — full можно не делать.
Чужую открытую документацию иногда проверяют так: запрашивают /llms-full.txt и загружают файл в модель с большим окном. Приём показывает удобство склейки. Он не оправдывает обход чужого robots.txt и не доказывает, что ваш интернет-магазин выиграет от такого же дампа.
Full-файл экономит обход, но тратит контекстное окно целиком. Это обмен, а не апгрейд llms.txt.
Чем llms.txt отличается от robots.txt и sitemap.xml
Четыре файла часто ставят в один ряд — зря. У каждого своя задача. llms.txt не заменяет robots.txt: индекс расставляет приоритеты цитирования, а правила обхода пишет другой файл. sitemap.xml перечисляет URL иначе, чем llms.txt: там адреса без аннотаций для модели.
| Файл | Задача | Типичный объём | Кто читает | Обязательность | Главный риск |
|---|---|---|---|---|---|
| llms.txt | Карта канонических материалов и приоритеты цитирования | Короткий индекс | Языковая модель | Нет | Устаревшие аннотации и мусорные URL |
| llms-full.txt | Весь корпус в одном markdown | Полный дамп | Языковая модель | Нет | Контекстное окно, утечки, устаревание |
| robots.txt | Правила обхода Allow и Disallow | Набор правил | Поисковые и AI-краулеры | Нет, нужна для управления обходом | Закрыть нужное или открыть лишнее |
| sitemap.xml | Список URL для индексации | Перечень адресов | Поисковые роботы | Нет | Дубли без аннотаций для модели |
Поисковому боту — robots.txt и sitemap.xml. Языковой модели — llms.txt. Полный корпус отдаёт только llms-full.txt, и не вместо остальных трёх. Это гигиена для моделей, а не замена SEO.
Короткая визитка в индексе полезнее простыни из всех адресов сайта: модели проще выбрать, что цитировать. robots.txt по-прежнему задаёт, какие URL можно обходить. Без него бот может прийти туда, куда вы его не звали, или не прийти туда, куда звали.
Факт. llms.txt не заменяет robots.txt: индекс задаёт приоритеты цитирования, а доступ краулера по-прежнему задаёт robots.txt.
Нужен ли сайту llms-full.txt: чек-лист по типам
Ответ зависит от типа сайта, а не от моды на формат. Лендингу и визитке почти всегда хватает короткого llms.txt. Полный дамп окупается на документации и базе знаний. Магазину с живыми ценами склейка скорее вредна.
| Тип сайта | llms.txt | llms-full.txt | Комментарий |
|---|---|---|---|
| Одностраничник | Нужен короткий | Не нужен | Корпус и так одна страница, склейка дублирует главную |
| Визитка | Нужен | Не нужен | Карты и одной markdown-визитки хватает |
| Корпоративный сайт | Нужен | Редко | Full только при большой базе знаний |
| Интернет-магазин / каталог | Нужен, без цен и карточек | Не нужен | Цены и остатки устаревают быстрее склейки |
| Блог | Нужен, вечнозелёные материалы | По объёму | Склейка — если корпус стабильный и не раздут |
| SaaS-документация и база знаний | Нужен | Нужен | Основной случай, когда полный файл окупается |
Критерии одни: объём стабильного текста, частота смены цен и остатков, есть ли база знаний, цена ошибки устаревшего дампа. Если у вас одностраничный сайт или визитка, полный файл занимает окно и повторяет то, что и так видно с главной.
Интернет-магазин — самый частый случай «нет» для full. Карточки, акции и остатки меняются быстрее, чем вы пересоберёте дамп. Документация продукта — самый частый случай «да»: корпус стабильный, его как раз удобно отдать одним файлом.
Мнение. Если у вас лендинг, визитка или магазин без базы знаний, берите только llms.txt. Полный дамп собирайте, когда корпус стабильный и его реально пересобирать.
Почему полный дамп может навредить
Больше текста не значит лучший ответ. Дамп вытесняет вопрос пользователя и соседние источники из контекстного окна. Модель тогда цитирует простыню, а не то, о чём спросили. Платить токенами за лишний корпус смысла нет, если запрос уже потерялся.
Склейка устаревает в тот день, когда на сайте меняется каноническая страница, а файл — нет. Нужен хозяин пересборки и пометка, когда дамп обновляли. Цены, акции и остатки в склейку не кладут: они сгорят раньше, чем вы заметите рассинхрон.
Отдельный риск — утечки. В дамп легко попадают черновики, /admin, коммерческие предложения, персональные данные и страницы с noindex. Если страница закрыта в robots.txt, её нельзя довезти через llms-full.txt: это обход собственного запрета. robots.txt задаёт доступ краулера; полный файл не должен открывать то, что закрыто для обхода.
Не стройте сниппеты на том, что поисковик проиндексирует llms-full.txt как обычную страницу: такой гарантии вендоры не дают. Сохраняйте UTF-8 и проверьте ответ сервера. Спецификация не фиксирует единственно верный MIME-тип: смотрите, что реально отдаёт ваш хостинг.
Если страница закрыта в robots.txt, её нельзя довезти через llms-full.txt. Это обход собственного запрета.
Как внедрить файлы на Bitrix, Tilda и WordPress
На Bitrix, Tilda, WordPress и самописе шаги одни и те же. Сначала список канонических URL, потом markdown, потом llms.txt в корне. Решение по full — только после чек-листа, не «заодно». Не обещайте заказчику файл «из коробки»: сначала проверьте, что плагин или компонент правда отдаёт /llms.txt из корня.
На 1С-Битрикс файл кладут в корень сайта на диске, рядом с robots.txt. Следите, чтобы ЧПУ не перехватывал /llms.txt и /llms-full.txt. На WordPress плагин имеет смысл, только если он правда отдаёт файл из корня: перед установкой откройте репозиторий и проверьте живой пример. На Тильде произвольный файл в корне домена часто не положить без своего хостинга или прокси.
Пересобирайте индекс после смены канонических страниц, а не ради календарной галочки. last-updated в файле помогает человеку и модели понять свежесть, но не заменяет проверку состава. Номер «единственно верного» MIME из чужого блога лучше не копировать: сверьтесь с ответом своего сервера.
Читают ли ChatGPT, Claude и Яндекс эти файлы
В публичной документации GPTBot, ClaudeBot, PerplexityBot, Google-Extended и ботов Яндекса нет прямого указания, что они читают /llms.txt или /llms-full.txt. llms.txt — добровольное предложение с llmstxt.org, не стандарт IETF или W3C. llms-full.txt в самой спецификации не описан: это соглашение, которое подхватили генераторы документации. Пока вендор сам не заявил поддержку, файл нельзя считать рычагом видимости в чате.
Живые адреса чужих llms.txt имеет смысл открывать руками перед тем, как ставить их в пример клиенту. Битую ссылку в статью и в индекс лучше не тащить. Готовых методик, которые доказывают рост цитирования изза файла, нет. Не обещайте заказчику видимость в чат-ботах.
Честный вывод такой. Файл — гигиена для моделей и удобство для людей, которые сами кормят документацию в чат. Это не рычаг классического SEO и не замена robots.txt. Если бот файл не запросил, у вас всё равно остаётся короткая карта сайта на человеческом языке — и это уже польза.
Частые ошибки и план на одну неделю
Типовой вредный набор один: пустой full как копия HTML, дамп «всего сайта», путаница с LMS, открытый дамп при закрытых в robots.txt ботах и файл, который никто не обновляет. Сначала карта. Полный дамп — по чек-листу, не по умолчанию.
- 01
Пустой llms-full.txt, который повторяет HTML. Не публикуйте склейку, пока нет markdown-версий канонических страниц.
- 02
Дамп всего сайта, включая фасеты и пагинацию. Склеивайте только то, что уже отобрано в llms.txt.
- 03
Ожидание, что файл заменит LMS. Learning management system учит людей, LLMs.txt модель не обучает.
- 04
AI-краулеры закрыты в robots.txt, а полный дамп открыт. Выровняйте правила: запрещённое для обхода не должно утекать склейкой.
- 05
Файл выложили и забыли. Назначьте хозяина пересборки или откажитесь от full.
Минимум без склейки выглядит так. Соберите канонические URL. Выложите llms.txt. По типу сайта решите, нужен ли full. Проверьте кодировку и заголовки. Просмотрите состав, если склейку всё же делаете. На одном llms.txt стоит остановиться, если нет базы знаний, мало стабильного текста, цены скачут или некому пересобирать дамп.
На сайте из одного HTML с водой канон лучше собрать заново. Подойдут тексты для сайта, а не абзацы, вырезанные из вёрстки. Пришлите структуру разделов, если нужно решить, выкладывать ли склейку: разберём состав индекса и скажем, где full только займёт контекст.
Источники
- llms.txt — llmstxt.org
- RFC 9309: Robots Exclusion Protocol — IETF
- Sitemaps XML format — sitemaps.org
- Файл robots.txt — Яндекс Вебмастер