Доступ ИИ-ботов: как пустить нейросети на сайт
Содержание
Чтобы нейросеть могла процитировать сайт, её робот сначала должен беспрепятственно получить страницу. Доступ ИИ-ботов - это разрешение краулерам нейросетей (YandexBot, GPTBot, PerplexityBot, ClaudeBot и другим) обходить сайт: не блокировать их в robots.txt и, что важнее, следить, чтобы хостинг или защитный экран не отдавали им ошибку. Если бот получает в ответ 403 или 503, сайта для нейросети просто нет - и никакая разметка это не спасёт. Для рунета ключевой бот - YandexBot: Нейро и Алиса берут ответы из индекса Яндекса.
Зачем пускать ИИ-ботов
Нейросеть не выдумывает ответ из воздуха - она собирает его из страниц, которые смог обойти её робот. Нет обхода - нет ни цитаты, ни ссылки в ответе. Поэтому доступ ИИ-ботов - это фундамент всего GEO: сколько ни размечай страницу и ни пиши «ответ-сразу», если краулер не получил её содержимое, всё остальное не имеет значения.
Логика простая, но именно этот шаг чаще всего пропускают: занимаются разметкой и текстом, а робота нейросети на сайт молча не пускает хостинг. Разберём, кого пускать и как убедиться, что доступ действительно открыт - на обеих дверях, а не только в robots.txt.
Какие ИИ-боты бывают
У каждого сервиса свой робот (или несколько) со своим User-Agent. Для рунета порядок приоритета такой:
- YandexBot - главный для нас. Отдельного «нейробота» у Яндекса нет: Нейро и Алиса формируют ответы из общего индекса Яндекса. Пускаете YandexBot - значит, работаете и на нейровыдачу.
- GPTBot и OAI-SearchBot (OpenAI) - первый собирает данные, второй обслуживает поиск в ChatGPT. Отдельно ChatGPT-User - заходы, когда пользователь сам просит открыть страницу.
- PerplexityBot (Perplexity) - индексирование для ответов Perplexity.
- ClaudeBot (Anthropic) - обход для Claude.
- Googlebot - поиск Google, он же питает AI Overviews; Google-Extended - не отдельный краулер, а токен в robots.txt для управления обучением Gemini.
- CCBot (Common Crawl) - открытый датасет, на котором учатся многие модели.
Список меняется - сервисы добавляют и переименовывают роботов. Держать точный перечень в голове не нужно; нужно понимать принцип и уметь проверить доступ (ниже).
Как разрешить их в robots.txt
По умолчанию, если в robots.txt для бота нет отдельного запрета, доступ открыт. То есть специально «разрешать» никого не требуется - достаточно не запрещать. Проблемы начинаются, когда в robots.txt стоит общий или точечный Disallow, унаследованный от старой настройки или CMS.
Если хотите разрешить явно - блок на бота выглядит так:
User-agent: GPTBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: YandexBot
Allow: /
И наоборот, закрыть конкретного бота - Disallow: / в его блоке. Но помните: robots.txt - это просьба, а не замок. Добросовестные боты (Яндекс, OpenAI, Google) её соблюдают; технически же доступ решается на другом уровне - и там кроется главная ловушка.
Подводные камни: robots.txt открыт, а бот не заходит
Самая частая и незаметная проблема - не robots.txt, а ответ сервера. Хостинг, защитный экран (WAF) или CDN могут блокировать запрос по User-Agent и отдавать ИИ-боту 403 или 503, хотя robots.txt полностью открыт. Для владельца сайт работает нормально - он же заходит из браузера; а робот нейросети раз за разом получает ошибку и уходит.
На практике это встречается на шаред-хостинге с включённым WAF: защита принимает ИИ-бота за подозрительный трафик и режет его по имени агента - иногда плавающе, то пуская, то отдавая 503. Лечится это не в robots.txt, а на стороне хостинга: в настройках WAF или через поддержку - снять блокировку конкретных User-Agent. Другие типичные источники - режим «блокировать ИИ-ботов» у CDN (например, Cloudflare) и security-плагины CMS со встроенными блок-листами.
Вывод: robots.txt - только первая дверь. Вторая, о которой забывают, - код ответа сервера под User-Agent бота. Пока не проверите вторую, вы не знаете, пущен бот или нет.
Как проверить доступ
Два способа, от простого к точному:
1. Эмулировать бота запросом. Отправьте запрос от имени бота и посмотрите код ответа:
curl -A "GPTBot" -I https://ваш-сайт.ru/
Ждём HTTP/... 200. Если пришло 403 или 503 - доступ режется на стороне сервера, разбираемся с хостингом или WAF. Проверьте так нескольких ботов: GPTBot, PerplexityBot, YandexBot.
2. Смотреть логи сервера. В логах доступа найдите строки с User-Agent ботов и их коды ответов за последнее время. Это показывает реальную картину: заходят ли боты и что получают. Если нужных ботов в логах нет вовсе - они до сайта не доходят.
Проверку стоит повторять после смены хостинга, включения нового WAF или CDN, установки security-плагина - именно эти события чаще всего незаметно закрывают ботов.
Пускать или закрывать: честный трейдофф
Открытый вопрос, на который нет универсального ответа. Пустить ИИ-ботов - значит дать шанс на попадание в ответы нейросетей, упоминания и трафик оттуда, но и согласиться, что ваш контент используется моделями. Закрыть - защитить контент, но стать невидимым в ИИ-ответах.
Для задачи продвижения в нейросетях выбор очевиден: ботов пускают, иначе вся работа по GEO бессмысленна. Если же контент принципиально закрытый или платный - блокировка тоже допустима, но она должна быть осознанным решением, а не случайным следствием настройки WAF. Худший вариант - хотеть в нейровыдачу и при этом молча резать ботов на хостинге.
Что дальше
Доступ - первый из четырёх рычагов попадания в нейросети (см. 4 рычага попадания в Яндекс Нейро). Когда боты пущены и это проверено - можно заниматься остальным: машиночитаемостью (в том числе файлом-картой llms.txt), приёмом «ответ-сразу» и авторитетом источника. Нужен результат под ключ - смотрите разбор оптимизации сайта под нейросети.
Частые вопросы
Каких ИИ-ботов пускать на сайт?
Для рунета главный - YandexBot: из индекса Яндекса ответы берут и Нейро, и Алиса. Дальше - боты западных сервисов: GPTBot и OAI-SearchBot (ChatGPT), PerplexityBot (Perplexity), ClaudeBot (Claude), плюс Googlebot и токен Google-Extended. Пускать стоит тех, в чьих ответах вы хотите появляться.
Как разрешить ИИ-ботов в robots.txt?
По умолчанию, если для бота нет запрета, доступ открыт. Достаточно не ставить ему Disallow; при желании можно прописать явный блок «User-agent: GPTBot / Allow: /». Главное - проверить, что доступ не режет что-то помимо robots.txt: security-плагин, CDN или защитный экран хостинга.
Почему ИИ-бот не заходит, хотя robots.txt его разрешает?
Частая причина - блокировка по User-Agent на уровне хостинга, WAF или CDN: сайт отдаёт боту 403 или 503, хотя robots.txt открыт. robots.txt - лишь одна из дверей; вторая, о которой забывают, - ответ сервера. Проверяется по логам и по коду ответа под User-Agent бота.
Не воруют ли ИИ-боты контент - стоит ли их вообще пускать?
Это выбор. Пустить - шанс попасть в ответы нейросетей и получить оттуда трафик и упоминания; закрыть - защита контента ценой невидимости в ИИ-ответах. Если цель - продвижение в нейросетях, ботов пускают; если контент принципиально закрытый - блокируют осознанно.
Пущу YandexBot - попаду в Нейро?
Доступ - необходимое условие, а не достаточное. Без доступа не попадёте точно; с доступом появляется шанс, который дальше решают фундамент сайта, прямой ответ на странице и авторитет источника.
Нужен разбор под ваш сайт?
Пройдите короткий тест и подберите формат: обучение один на один, если хотите вести SEO сами, или аудит с планом правок, если нужно сделать за вас.
