Пускает ли robots.txt
Файла robots.txt на сайте нет. Правил нет — значит формально
пускает всех.
инструменты / нейросети
Посмотрим, дойдёт ли до сайта бот нейросети, пустит ли его сервер и что он
там увидит. Отвечаем находками и готовыми строками для robots.txt,
а не баллом. Вход не нужен.
Проверка идёт с нашего адреса: мы подставляем имя бота в запрос и сравниваем ответ с ответом обычному браузеру. Сайт, который фильтрует не по имени бота, а по адресам сетей OpenAI или Яндекса, так не поймать — там наш запрос выглядит как чужой. И мы не запускаем скрипты, ровно как их не запускают сами боты.
Файла robots.txt на сайте нет. Правил нет — значит формально
пускает всех.
robots.txt — это просьба, а отказ сервера — запрет. Здесь
видно, отвечает ли сервер боту не так, как обычному посетителю.
Скопируйте нужный кусок в конец файла robots.txt в корне
сайта. Разделы перечислены поимённо: так надёжнее, чем звёздочкой,
и не заденет обычный поиск.
Только те боты, которые сейчас закрыты.
Содержимое не пойдёт в обучение моделей, но сайт останется доступен для ответов на вопросы людей и для ИИ-поиска.
Нейросети берут содержимое сайтов не так, как обычный поиск. У каждой компании не один бот, а несколько, и у них разные задачи: один собирает тексты для обучения модели, другой строит индекс для поиска внутри чата, третий заходит на страницу прямо в тот момент, когда человек задал вопрос. Закрыть их можно по отдельности — и это главное, чего не видно в отчётах, сводящих всё к одному баллу.
Разница важная. Запретить обучение и остаться в ответах — осмысленная
настройка, так прямо и написано в документации OpenAI. А вот закрыть ботов,
которые приносят ответы, почти всегда выходит случайно: одной строкой
Disallow: / в общем разделе, поставленной когда-то совсем
по другому поводу.
Четыре блока, и каждый отвечает на свой вопрос. Порядок не случайный: он идёт от того, что чаще всего сломано, к тому, что тоньше.
Разрешён ли каждый из тринадцати ботов по имени. Если закрыт — показываем, какой именно строкой и в каком разделе файла, дословно и с номером строки, чтобы её можно было найти глазами и поправить.
Что сервер отвечает боту на самом деле. Файл robots.txt — это
просьба, и её можно выполнить, а можно и нет. Отказ сервера обсуждению
не подлежит: если приходит 403, никакие разрешения в файле уже не помогут.
Сколько текста видно в исходном HTML, есть ли заголовок окна, H1, дата и автор. Боты не выполняют скрипты, поэтому страница, которую рисует JavaScript, для них пустая, как бы полно она ни выглядела у человека.
Есть ли файл llms.txt и объявлен ли он в шапке, есть ли разметка
Schema.org и каких типов. Это то, чем сайт сам рассказывает машине, что он
такое, — без разметки её приходится угадывать по тексту.
Цвет значит вердикт и ничего больше. Красным помечено то, из-за чего сайт теряет ответы нейросетей прямо сейчас. Обычным цветом — то, что стоит посмотреть, но само по себе бедой не является. Зелёным — то, что настроено верно, и мы говорим об этом вслух, чтобы никто не бросился чинить исправное.
Самое неочевидное место — запрет обучения. Если в файле закрыты
GPTBot, ClaudeBot и Google-Extended,
а боты ответов открыты, это зелёная строка, а не потеря.
Владелец сознательно решил не отдавать содержимое в обучение моделей
и при этом остаться в ответах — так и задумано теми, кто эти боты сделал.
В разделе User-agent: * стоит Disallow: /. Это
не про нейросети: закрыт обход всего сайта, и обычный поиск сайт теряет
первым. Обычно такая строка остаётся с этапа разработки, когда сайт прятали
от индексации, и её просто забыли снять. Чинить в первую очередь.
Осознанная настройка, а не недостача. Содержимое не идёт в обучение моделей, но сайт остаётся доступен для ответов на вопросы людей и для ИИ-поиска. Делать ничего не нужно — мы помечаем такой случай зелёным именно поэтому.
Самая ценная находка проверки и единственная, которую больше нигде не видно.
Запросы отклоняют по имени бота: защита от ботов, настройка хостера или
правило в конфигурации сервера. Правка robots.txt тут бесполезна,
идти нужно в настройки защиты сайта или к хостеру.
Содержимое рисуют скрипты уже в браузере. Бот видит пустую оболочку и уходит ни с чем. Лечится отдачей готового HTML с сервера хотя бы для главных страниц. Это работа разработчика, а не настройка, и обычно самая дорогая из всего списка — зато без неё остальное бессмысленно.
Список сверен с документацией владельцев 05.09.2026. Имена ботов меняются несколько раз в год, поэтому мы держим дату сверки на виду и не пишем ничего по памяти.
GPTBot
OpenAI
— Собирает страницы для обучения моделей OpenAI. Запрет говорит, что содержимое сайта не должно попадать в обучающие наборы. ClaudeBot
Anthropic
— Собирает содержимое, которое может пойти в обучение моделей Claude. Запрет означает, что будущие материалы сайта в обучение не попадут. Своей строки User-Agent владелец не публикует,
поэтому ответ сервера этому боту мы не проверяем.
Google-Extended
Google
— Управляет тем, идёт ли содержимое сайта в обучение и в ответы ИИ Google. Своей строки User-Agent у него нет: это только токен для robots.txt. Своей строки User-Agent владелец не публикует,
поэтому ответ сервера этому боту мы не проверяем.
OAI-SearchBot
OpenAI
— Собирает страницы для поиска ChatGPT. Именно его надо разрешить, чтобы сайт появлялся в результатах, — от обучения это не зависит. Claude-SearchBot
Anthropic
— Индексирует страницы, чтобы точнее отвечать в поиске. Запрет убирает сайт из этого индекса и снижает шансы попасть в ответ. Своей строки User-Agent владелец не публикует,
поэтому ответ сервера этому боту мы не проверяем.
PerplexityBot
Perplexity
— Показывает сайт и ссылку на него в результатах Perplexity. Для обучения моделей не используется. ChatGPT-User
OpenAI
— Заходит на страницу, когда человек задал вопрос в ChatGPT. Для обхода сайтов не используется. Claude-User
Anthropic
— Заходит на страницу по запросу человека. Запрет мешает системе взять содержимое сайта в ответ на вопрос пользователя. Своей строки User-Agent владелец не публикует,
поэтому ответ сервера этому боту мы не проверяем.
Perplexity-User
Perplexity
— Заходит на страницу, когда человек задал вопрос, и ставит ссылку на неё в ответе. Для обхода сайтов не используется. YandexAdditional
Яндекс
— Отвечает за показ страницы в быстрых ответах с YandexGPT и в ответах Поиска с Алисой. YandexAdditionalBot
Яндекс
— Второе имя того же назначения: показ страницы в быстрых ответах с YandexGPT и в ответах Поиска с Алисой. GoogleOther
Google
— Служебные обходы Google, не связанные с обычным поиском. Google-CloudVertexBot
Google
— Обходит сайты по заказу их же владельцев для Vertex AI. Отдельной строки User-Agent не заявлено. Своей строки User-Agent владелец не публикует,
поэтому ответ сервера этому боту мы не проверяем.
Сервисы, которые меряют готовность сайта к ИИ-поиску, обычно устроены одинаково: бесплатно показывают общий балл и список проблемных зон, а сам разбор и материалы для внедрения открывают после регистрации или в платном тарифе. Балл удобно показать в отчёте, но по нему нельзя ничего починить: он не говорит, какая строка какого файла закрывает какого бота.
Мы сделали ровно наоборот. Регистрации нет, весь ответ виден сразу, вместо
балла — находки с цитатой строки и номером, а готовые строки для
robots.txt собираются под конкретный сайт и лежат тут же,
бесплатно. Взамен мы не беремся за то, чего проверить не можем, — об этом
ниже отдельно.
robots.txt. Взять готовый кусок из
результата и дописать в конец файла в корне сайта. Если файла нет вовсе,
его достаточно создать с этими же строками.
robots.txt
роботы перечитывают не мгновенно, но наша проверка читает его сразу — она
покажет, что строки встали как надо.
Мы не отвечаем на вопрос «советует ли вас ChatGPT». Такой ответ невозможно ни воспроизвести, ни проверить: модели отвечают по-разному от запроса к запросу. Мы отвечаем на соседний и честный вопрос — может ли бот дойти до сайта и прочитать то, что там написано. Без этого разговор про упоминания не имеет смысла, а с этим он хотя бы начинается.
Подробный разбор того, что мы тут проверяем бегло, живёт в соседних инструментах: проверка файла llms.txt, проверка микроразметки. Зачем разметка нейросетям и что она меняет, разобрали отдельно — нужен ли JSON-LD для ChatGPT.
Это решение владельца, и одного ответа на всех нет. Закрыть обучение имеет смысл, если содержимое сайта и есть ваш товар: тексты, фотографии, база знаний. А вот закрывать ботов, которые приносят ответы, обычно не стоит — это то же самое, что закрыться от поиска.
У него нет собственной строки User-Agent, так написано в документации Google. Это только имя для robots.txt, а обход идёт обычными агентами Google. Проверять тут нечего, а выдумывать несуществующее имя мы не станем.
Cloudflare умеет встречать ботов проверкой браузера, которую бот пройти не может. Если так и есть, мы это увидим и назовём. Но сам по себе Cloudflare ничего не значит: он стоит перед половиной рунета и обычно никому не мешает.
Да, и это её граница. Мы подставляем имя бота в запрос со своего сервера. Сайт, который фильтрует по спискам сетей, а не по имени, так не поймать. Об этом написано прямо над формой, а не мелким шрифтом внизу.
Дата последней сверки напечатана выше. Имена появляются и меняются несколько раз в год, поэтому мы пересверяем список с документацией владельцев и показываем, когда делали это в последний раз.
Взять готовые строки из результата проверки и дописать их в конец файла robots.txt в корне сайта. Разделы там перечислены поимённо: так надёжнее звёздочки и не заденет обычный поиск. Если файла нет вовсе, его достаточно создать с этими же строками.