llms.txt и AI-краулеры: управление доступом нейросетей
Сайты теперь читают не только Яндекс и Google, но и боты нейросетей — ChatGPT, Perplexity, Claude и другие. Они берут с сайтов информацию для ответов и обучения. Появились два новых инструмента, чтобы этим управлять: llms.txt (рассказать ИИ о сайте) и блокировка AI-краулеров через robots.txt (решить, кого пускать). Разберём оба.
Что такое llms.txt
llms.txt — простой markdown-файл в корне сайта (/llms.txt), который даёт нейросетям чистую «выжимку»: название, описание и список главных страниц без меню, рекламы и скриптов. У ИИ-моделей ограничен контекст, и такой файл помогает им быстрее и точнее понять, о чём ресурс. Это часть нового направления — оптимизации под нейросети (GEO). Формат простой:
# Название сайта > Краткое описание в одну-две строки. ## Основные страницы - [Заголовок](https://сайт.ру/page): о чём страница - [Блог](https://сайт.ру/blog/): статьи и гайды
Что писать в llms.txt
Файл должен быть коротким и по делу — это выжимка, а не копия сайта. В начале — название и одна-две строки о том, чем сайт полезен и для кого. Дальше список самых важных страниц со ссылками и кратким пояснением к каждой: главные разделы, ключевые гайды, документация, страницы услуг. Цель — чтобы нейросеть, прочитав файл, сразу поняла суть ресурса и знала, куда смотреть за деталями. Не вставляйте сюда всё подряд: лучше десяток действительно важных страниц, чем сотня второстепенных. Иногда дополнительно делают llms-full.txt — расширенную версию с полным текстом ключевых материалов, но для большинства сайтов хватает обычного краткого llms.txt.
Статус llms.txt: что важно понимать
Здесь нужна честность: llms.txt — это предложенный стандарт, а не общепринятое требование. На сегодня далеко не все ИИ-системы его читают и учитывают, единого обязательного формата нет, и гарантий, что нейросеть воспользуется вашим файлом, никто не даёт. Но добавить его стоит по простой причине: это дёшево и безопасно. Файл собирается за пару минут, ничего не ломает, не вредит обычному SEO, а по мере того как ИИ-поиск растёт, заранее подготовленный сайт оказывается в выигрыше. Относитесь к llms.txt как к недорогой инвестиции в будущее, а не к волшебной кнопке: сделали — и пусть лежит.
Основные AI-краулеры
У каждой ИИ-компании свои боты, и у них разное назначение — обучение моделей, ответы в реальном времени, поисковый индекс. Главные:
| Бот | Кто и зачем |
|---|---|
| GPTBot | OpenAI — сбор данных для обучения моделей |
| OAI-SearchBot | OpenAI — поиск и ссылки в ChatGPT |
| ChatGPT-User | OpenAI — переход по запросу пользователя |
| ClaudeBot | Anthropic — обучение и ответы Claude |
| PerplexityBot | Perplexity — поисковый ИИ-ответчик |
| Google-Extended | Google — обучение Gemini (отдельно от поиска) |
| Applebot-Extended | Apple — обучение ИИ Apple |
| Bytespider | ByteDance (TikTok) — сбор данных |
Как разрешить или закрыть ИИ-ботов
Доступом управляет robots.txt. Чтобы закрыть конкретного бота, добавьте блок с его именем и Disallow: /. Например, закрыть обучающих, но оставить поисковых ИИ (чтобы сайт цитировался в ответах):
User-agent: GPTBot Disallow: / User-agent: Google-Extended Disallow: / User-agent: CCBot Disallow: / User-agent: PerplexityBot Allow: /
Важно: Google-Extended отвечает только за обучение Gemini и не влияет на обычный поиск Google — блокировка не уронит позиции. А вот закрывать поисковых ИИ-ботов (OAI-SearchBot, PerplexityBot) стоит осознанно: так вы исчезаете из ответов нейропоиска.
Соберите llms.txt для своего сайта
Подскажите нейросетям, о чём ваш сайт — бесплатно, за пару минут.
Генератор llms.txt →ИИ-боты и нагрузка на сервер
Помимо вопроса «пускать ли», у ИИ-краулеров есть чисто технический аспект — нагрузка. Некоторые боты ходят по сайту агрессивно, скачивая страницы пачками, и на крупном сайте это заметно нагружает сервер, как лишний наплыв посетителей. Особенно этим известны боты-сборщики данных. Если вы видите, что какой-то ИИ-бот «выедает» ресурсы, варианты такие: полностью закрыть его в robots.txt либо, если хостинг позволяет, ограничить частоту его запросов. Это отдельная история от индексации: тут речь не о SEO, а о том, чтобы чужой сбор данных не мешал работе сайта. На небольших сайтах проблема обычно незаметна, а вот крупным стоит держать её в поле зрения.
Как узнать, кто к вам ходит
Прежде чем кого-то блокировать, полезно посмотреть, какие ИИ-боты вообще заходят на ваш сайт и как часто. Самый надёжный источник — логи сервера: в них у каждого визита записан User-Agent, и по нему видно GPTBot, ClaudeBot, PerplexityBot и прочих. Так вы поймёте, кто реально к вам ходит и сколько берёт страниц, а не блокируете вслепую. Заодно по логам видно, соблюдает ли бот ваш robots.txt: если закрыли, а он всё равно ломится, — это сигнал, что добровольные правила он игнорирует, и нужны более жёсткие меры на уровне сервера. Большинству сайтов достаточно периодически заглядывать в логи, а не следить постоянно.
GEO: попасть в ответы нейросетей
llms.txt и доступ ботов — это про «технический вход» для ИИ, но чтобы реально попадать в ответы нейропоиска, нужно больше. Это направление называют GEO — оптимизация под генеративный поиск. Логика похожа на обычное SEO, но с акцентами под то, как ИИ собирает ответы: давайте чёткие прямые ответы на вопросы (их легко процитировать), опирайтесь на факты и цифры, структурируйте материал заголовками и списками, добавляйте FAQ. Нейросеть охотнее берёт в ответ понятный, фактурный, хорошо структурированный фрагмент, чем размытую «воду». Так что llms.txt откройте, ботов настройте — но главную работу делает по-прежнему качественный, удобный для цитирования контент. Подробнее — в статье про GEO-оптимизацию под нейросети.
Блокировать или пускать?
Однозначного ответа нет — это компромисс. Пускать поисковых ИИ выгодно для видимости: сайт цитируется в ответах ChatGPT и Perplexity, приходит трафик и упоминания бренда. Закрывать обучающих ботов разумно, если не хотите, чтобы контент уходил в обучение моделей без отдачи. Частый разумный баланс: разрешить поисковых ИИ (для трафика), ограничить чисто обучающих. Но учтите — соблюдение robots.txt у ИИ-ботов добровольное, гарантии нет.
Коротко: llms.txt рассказывает нейросетям о сайте и его главных страницах, а через robots.txt вы пускаете или закрываете ИИ-ботов (GPTBot, ClaudeBot, PerplexityBot, Google-Extended и др.). Google-Extended не влияет на обычный поиск, а блокировка поисковых ИИ убирает сайт из их ответов — решайте по целям. Как в целом готовить сайт под нейросети — в статье GEO: оптимизация под нейросети.