инструменты для сайта

инструменты / нейросети

Проверка сайта для нейросетей

Посмотрим, дойдёт ли до сайта бот нейросети, пустит ли его сервер и что он там увидит. Отвечаем находками и готовыми строками для robots.txt, а не баллом. Вход не нужен.

Проверка идёт с нашего адреса: мы подставляем имя бота в запрос и сравниваем ответ с ответом обычному браузеру. Сайт, который фильтрует не по имени бота, а по адресам сетей OpenAI или Яндекса, так не поймать — там наш запрос выглядит как чужой. И мы не запускаем скрипты, ровно как их не запускают сами боты.

Что тут проверяется

Нейросети берут содержимое сайтов не так, как обычный поиск. У каждой компании не один бот, а несколько, и у них разные задачи: один собирает тексты для обучения модели, другой строит индекс для поиска внутри чата, третий заходит на страницу прямо в тот момент, когда человек задал вопрос. Закрыть их можно по отдельности — и это главное, чего не видно в отчётах, сводящих всё к одному баллу.

Разница важная. Запретить обучение и остаться в ответах — осмысленная настройка, так прямо и написано в документации OpenAI. А вот закрыть ботов, которые приносят ответы, почти всегда выходит случайно: одной строкой Disallow: / в общем разделе, поставленной когда-то совсем по другому поводу.

Что именно мы смотрим

Четыре блока, и каждый отвечает на свой вопрос. Порядок не случайный: он идёт от того, что чаще всего сломано, к тому, что тоньше.

Разрешён ли бот в robots.txt

Разрешён ли каждый из тринадцати ботов по имени. Если закрыт — показываем, какой именно строкой и в каком разделе файла, дословно и с номером строки, чтобы её можно было найти глазами и поправить.

Отвечает ли сервер боту

Что сервер отвечает боту на самом деле. Файл robots.txt — это просьба, и её можно выполнить, а можно и нет. Отказ сервера обсуждению не подлежит: если приходит 403, никакие разрешения в файле уже не помогут.

Останется ли текст без скриптов

Сколько текста видно в исходном HTML, есть ли заголовок окна, H1, дата и автор. Боты не выполняют скрипты, поэтому страница, которую рисует JavaScript, для них пустая, как бы полно она ни выглядела у человека.

Объявляет ли сайт себя машине

Есть ли файл llms.txt и объявлен ли он в шапке, есть ли разметка Schema.org и каких типов. Это то, чем сайт сам рассказывает машине, что он такое, — без разметки её приходится угадывать по тексту.

Как читать результат

Цвет значит вердикт и ничего больше. Красным помечено то, из-за чего сайт теряет ответы нейросетей прямо сейчас. Обычным цветом — то, что стоит посмотреть, но само по себе бедой не является. Зелёным — то, что настроено верно, и мы говорим об этом вслух, чтобы никто не бросился чинить исправное.

Самое неочевидное место — запрет обучения. Если в файле закрыты GPTBot, ClaudeBot и Google-Extended, а боты ответов открыты, это зелёная строка, а не потеря. Владелец сознательно решил не отдавать содержимое в обучение моделей и при этом остаться в ответах — так и задумано теми, кто эти боты сделал.

Четыре случая, которые встречаются чаще всего

Закрыты все тринадцать одной строкой

В разделе User-agent: * стоит Disallow: /. Это не про нейросети: закрыт обход всего сайта, и обычный поиск сайт теряет первым. Обычно такая строка остаётся с этапа разработки, когда сайт прятали от индексации, и её просто забыли снять. Чинить в первую очередь.

Закрыты боты обучения, остальные открыты

Осознанная настройка, а не недостача. Содержимое не идёт в обучение моделей, но сайт остаётся доступен для ответов на вопросы людей и для ИИ-поиска. Делать ничего не нужно — мы помечаем такой случай зелёным именно поэтому.

robots.txt пускает, а сервер отвечает отказом

Самая ценная находка проверки и единственная, которую больше нигде не видно. Запросы отклоняют по имени бота: защита от ботов, настройка хостера или правило в конфигурации сервера. Правка robots.txt тут бесполезна, идти нужно в настройки защиты сайта или к хостеру.

Слов в HTML почти нет, а страница на вид полная

Содержимое рисуют скрипты уже в браузере. Бот видит пустую оболочку и уходит ни с чем. Лечится отдачей готового HTML с сервера хотя бы для главных страниц. Это работа разработчика, а не настройка, и обычно самая дорогая из всего списка — зато без неё остальное бессмысленно.

Каких ботов мы знаем

Список сверен с документацией владельцев 05.09.2026. Имена ботов меняются несколько раз в год, поэтому мы держим дату сверки на виду и не пишем ничего по памяти.

Обучение моделей

Индекс ИИ-поиска

Ответ на вопрос человека

Прочие обходы

Чем это отличается от других проверок

Сервисы, которые меряют готовность сайта к ИИ-поиску, обычно устроены одинаково: бесплатно показывают общий балл и список проблемных зон, а сам разбор и материалы для внедрения открывают после регистрации или в платном тарифе. Балл удобно показать в отчёте, но по нему нельзя ничего починить: он не говорит, какая строка какого файла закрывает какого бота.

Мы сделали ровно наоборот. Регистрации нет, весь ответ виден сразу, вместо балла — находки с цитатой строки и номером, а готовые строки для robots.txt собираются под конкретный сайт и лежат тут же, бесплатно. Взамен мы не беремся за то, чего проверить не можем, — об этом ниже отдельно.

Что делать после проверки

  1. Поправить robots.txt. Взять готовый кусок из результата и дописать в конец файла в корне сайта. Если файла нет вовсе, его достаточно создать с этими же строками.
  2. Если режет сервер — написать хостеру. Отказ сервера настройкой файла не лечится. Просить разрешить перечисленные имена ботов или снять для них проверку браузера.
  3. Проверить, что видно без скриптов. Если слов оказалось мало, а страница полная, вопрос к разработчику: содержимое главных страниц должно приходить готовым HTML.
  4. Дать машине понять, что это за страница. Разметка Schema.org, заголовок H1, дата и автор — то, по чему материал берут в ответ и на что ссылаются.
  5. Перепроверить после правок. Файл robots.txt роботы перечитывают не мгновенно, но наша проверка читает его сразу — она покажет, что строки встали как надо.

Чего мы не делаем

Мы не отвечаем на вопрос «советует ли вас ChatGPT». Такой ответ невозможно ни воспроизвести, ни проверить: модели отвечают по-разному от запроса к запросу. Мы отвечаем на соседний и честный вопрос — может ли бот дойти до сайта и прочитать то, что там написано. Без этого разговор про упоминания не имеет смысла, а с этим он хотя бы начинается.

Подробный разбор того, что мы тут проверяем бегло, живёт в соседних инструментах: проверка файла llms.txt, проверка микроразметки. Зачем разметка нейросетям и что она меняет, разобрали отдельно — нужен ли JSON-LD для ChatGPT.

Вопросы

Стоит ли вообще закрывать ИИ-ботов

Это решение владельца, и одного ответа на всех нет. Закрыть обучение имеет смысл, если содержимое сайта и есть ваш товар: тексты, фотографии, база знаний. А вот закрывать ботов, которые приносят ответы, обычно не стоит — это то же самое, что закрыться от поиска.

Почему у Google-Extended не проверяется ответ сервера

У него нет собственной строки User-Agent, так написано в документации Google. Это только имя для robots.txt, а обход идёт обычными агентами Google. Проверять тут нечего, а выдумывать несуществующее имя мы не станем.

Сайт стоит за Cloudflare, что это меняет

Cloudflare умеет встречать ботов проверкой браузера, которую бот пройти не может. Если так и есть, мы это увидим и назовём. Но сам по себе Cloudflare ничего не значит: он стоит перед половиной рунета и обычно никому не мешает.

Проверка идёт с вашего адреса, а не с адреса бота

Да, и это её граница. Мы подставляем имя бота в запрос со своего сервера. Сайт, который фильтрует по спискам сетей, а не по имени, так не поймать. Об этом написано прямо над формой, а не мелким шрифтом внизу.

Как часто обновляется список ботов

Дата последней сверки напечатана выше. Имена появляются и меняются несколько раз в год, поэтому мы пересверяем список с документацией владельцев и показываем, когда делали это в последний раз.

Что делать, если бот закрыт, а закрывать не хотели

Взять готовые строки из результата проверки и дописать их в конец файла robots.txt в корне сайта. Разделы там перечислены поимённо: так надёжнее звёздочки и не заденет обычный поиск. Если файла нет вовсе, его достаточно создать с этими же строками.