инструменты / микроразметка / json-ld для нейросетей
Нужен ли JSON-LD для ChatGPT и нейросетей
Короткий ответ — нет. Ни один первоисточник не подтверждает, что разметка JSON-LD помогает странице попасть в ответы нейросетей. Google в справке про ИИ-функции поиска пишет прямо: чтобы появляться в AI Overviews и AI Mode, не нужно ни новых машиночитаемых файлов, ни особой разметки Schema.org. Документация OpenAI про GPTBot и OAI-SearchBot и справка Anthropic про ClaudeBot не упоминают JSON-LD вовсе. Открытое измерение Ahrefs на 1885 страницах, добавивших разметку, значимого прироста цитирований в ChatGPT и AI Mode не нашло.
Мы проверили это же с другой стороны: посмотрели, что стоит у сайтов, которые и без всяких нейросетей уже занимают верх выдачи. Из 103 страниц топ-20 Яндекса по восьми коммерческим запросам JSON-LD оказался у 48 — то есть у меньшинства. У 23 нет вообще никакой разметки, ни новой, ни старой. А устаревшие микроданные встречаются даже чаще современного JSON-LD.
Ставить разметку при этом стоит — но не ради ChatGPT, а ради расширенного сниппета в обычном поиске. Справка Яндекса говорит про разметку ровно одно: «вы можете улучшить представление сниппета вашего сайта в результатах поиска». Что именно в этот сниппет попадает — цена и наличие у товара, крошки над заголовком, карточка организации с адресом и телефоном — это уже наш перечень, а не цитата из справки. Довод «внедрите JSON-LD, потому что так вас процитируют нейросети» сегодня не подпирается ни одним документом Google, OpenAI, Anthropic или Яндекса.
Что нейросети читают на самом деле
Единственное прямое высказывание первоисточника тут принадлежит Google,
и оно отрицательное. В
справке
про ИИ-функции поиска сказано дословно: «You don't need to create new
machine readable files, AI text files, or markup to appear in these
features. There's also no special schema.org structured data that you need
to add». Участие в ИИ-ответах управляется там же обычным: robots.txt для
Googlebot, показ фрагментов — nosnippet,
data-nosnippet, max-snippet, noindex.
Остальные документы мы читали целенаправленно: искали слова «JSON-LD», «schema.org», «structured data», «Open Graph» и указание, рендерят ли боты JavaScript. У OpenAI не нашлось ни одного из этих слов — ни JSON-LD, ни schema.org, ни structured data, ни Open Graph, ни ответа про JavaScript, и это вдобавок единственная официальная страница про их ботов. У Anthropic нет ни JSON-LD, ни schema.org, ни structured data. У Яндекс.Нейро нет ни микроразметки, ни structured data, ни schema.org. У Google-Agent — ни structured data, ни JSON-LD. Вот что там есть вместо этого.
- Google-Extended — токен robots.txt: попадёт ли содержимое сайта в обучение будущих поколений Gemini. Там же: «does not impact a site's inclusion in Google Search nor is it used as a ranking signal in Google Search».
- Google-Agent — с 20 марта 2026 года: агенты на инфраструктуре Google «навигируют по вебу и выполняют действия по запросу пользователя». Это пользовательский загрузчик, а не краулер: robots.txt не соблюдает. Там же — эксперимент с подписью запросов Web Bot Auth.
- GPTBot и OAI-SearchBot у OpenAI — одним документом. Первый собирает содержимое для обучения генеративных моделей (запрет ему = «не брать в обучение»). Второй «is used to surface websites in search results in ChatGPT's search features»: закрытые от него сайты в ответах ChatGPT не показываются, но могут появиться навигационной ссылкой.
- Три бота Anthropic: ClaudeBot — обучение моделей, Claude-User — заход по запросу пользователя Claude (про запрет справка честно предупреждает: «may reduce your site's visibility for user-directed web search»), Claude-SearchBot — качество поисковых ответов. Все три собирают «web content», без детализации формата.
- Яндекс про schema.org: «вы можете улучшить представление сниппета вашего сайта в результатах поиска» — и тут же: «Робот Яндекса сможет проиндексировать информацию с сайта и без разметки, на показ страниц в поиске это не повлияет». Про генеративные ответы — ничего.
- Яндекс
про Нейро: источники отбираются по экспертности, полезности,
оригинальности и содержательности — микроразметки среди критериев нет.
Показ в ответах Алисы закрывается
отдельной
директивой для
YandexAdditionalBot, изменение учитывается «в течение 2-14 дней». - Сам
словарь schema.org, версия 30.0 от 19 марта 2026 года:
аннотации эквивалентности с GS1, Dublin Core и Open Graph, примеры
цифрового паспорта продукта ЕС, классы
CredentialиError, наследованиеQuantity, свойства уJobPosting,PersonиLocalBusiness. Ни одного типа и ни одного свойства под ИИ-агентов и языковые модели.
Два измерения с открытым методом смотрят туда же. Ahrefs отследил 1885 страниц, добавивших JSON-LD с августа 2025 по март 2026, и сопоставил с контролем: на каждую подопытную — по три контрольных адреса с других доменов и с похожим уровнем цитирования до внедрения, а всего контрольных, по их словам, 4000. Эти два числа у авторов между собой не сходятся — по три на 1885 подопытных дают 5655, — объяснения в их статье нет; вероятно, часть контрольных адресов использована повторно. Метод — сопоставленная разность разностей с проверкой на устойчивость. Результат: Google AI Overviews −4,6%, Google AI Mode +2,4%, ChatGPT +2,2%. Сдвиги в AI Mode и ChatGPT авторы сами называют статистически неотличимыми от шума, снижение в AI Overviews — «небольшим, но значимым». Оговорок у них три: страницы, добавляющие разметку, обычно правят заодно и другое; выборка — уже сильно цитируемые страницы; окно замера — 30 дней после внедрения.
Второе — Vercel вместе с MERJ: 569 млн запросов GPTBot и 370 млн запросов краулера Claude за месяц по сети Vercel, и ни одного случая исполнения JavaScript. Файлы JavaScript боты качают (у GPTBot 11,50% запросов, у ClaudeBot 23,84%), но не выполняют. Вывод отсюда и про разметку: чего нет в исходном HTML-ответе сервера, того ИИ-краулер, скорее всего, не увидит вовсе.
Что кочует по гайдам без подтверждения
Ниже пять утверждений, которые в статьях по теме печатаются как факт. Мы искали им подтверждение специально и не нашли — поэтому называем это вслух, а не выдаём за знание.
- «ChatGPT читает данные из блоков
ld+jsonотдельно от видимого текста страницы». Живёт на наблюдениях участников форума OpenAI, причём наблюдения противоречат друг другу: один уверяет, что видел в ответе данные, которых в видимом HTML нет, другой возражает, что данные игнорировались, пока не появились в теле страницы. Ответа сотрудника OpenAI в треде нет, в документации по GPTBot и OAI-SearchBot — тоже. - «Разметка, отданная в первом HTML-ответе, точно распознаётся моделями как структурированные данные». Единственное место, где это вообще сказано, — та же статья Vercel и MERJ, и сказано предположением: содержимое из первого ответа «may still be indexed since AI models can interpret non-HTML content». Отдельно обработку структурированных данных авторы не проверяли, весь их массив собран про исполнение JavaScript.
- «Google-Extended рендерит JavaScript, раз пользуется инфраструктурой Googlebot». На официальной странице Google про этот токен про рендеринг не сказано ничего — только про назначение и про отсутствие влияния на ранжирование.
- «Разметка
FAQPage,ArticleилиLocalBusinessповышает шанс попасть в цитаты ChatGPT и AI Overviews». Самое частое утверждение в гайдах — и ни OpenAI, ни Google его не подтверждают. Единственное прямое высказывание Google на смежную тему обратное, а измерение Ahrefs значимого прироста не нашло. - «Разметка
SearchActionобъясняет ИИ-ботам, как взаимодействовать с сайтом». Ни у OpenAI, ни у Anthropic, ни у Google нет ни слова проSearchActionкак канал связи с ИИ-ботами. Этот тег придуман для поисковой строки в сниппете Google, и переосмысление его в «инструкцию для нейросети» нигде официально не подтверждено.
Мы проверили 115 страниц из выдачи
Замер от 29 августа 2026 года.
Первоисточники говорят, чего делать не нужно. Нам было интересно и обратное: что на самом деле стоит у тех, кто уже стоит в топе. Взяли восемь коммерческих запросов из восьми разных ниш — «пластиковые окна купить», «кровельные материалы купить», «аренда спецтехники», «стоматология услуги цены», «детская одежда интернет магазин», «доставка цветов», «натяжные потолки цена», «корм для собак купить». По каждому сняли топ-20 органической выдачи Яндекса по Москве. После склейки по домену — одна строка на домен, повторы внутри ниши и между нишами схлопнуты — осталось 115 адресов. Каждый открыли нашим же инструментом проверки разметки: он читает исходный HTML-ответ сервера — так же, как его читают ИИ-краулеры, у которых Vercel и MERJ на полумиллиарде запросов не нашли ни одного случая исполнения JavaScript.
Сначала — что вообще ответило. Эти цифры мы не растворяем в остальных: сайты, которые не открылись, в «разметки нет» не записаны. Строка «иное» — это всё, что не было ни успешным ответом, ни отказом 403, ни таймаутом.
| Исход | Адресов | Доля от 115 |
|---|---|---|
| Ответила | 103 | 89,6% |
| Отказ 403 | 5 | 4,3% |
| Иное | 6 | 5,2% |
| Таймаут | 1 | 0,9% |
| Редирект | 0 | 0% |
| Итого | 115 | 100% |
Дальше знаменатель везде один и тот же — 103 ответившие страницы, а не 115 адресов выборки.
| Что нашли | Адресов | Доля от 103 |
|---|---|---|
ld+json читается | 48 | 46,6% |
ld+json битый | 1 | 1,0% |
только microdata | 31 | 30,1% |
| Разметки нет | 23 | 22,3% |
| Итого | 103 | 100% |
Если сравнивать не качество, а форматы, картина ещё показательнее.
ld+json в любом виде, исправный и битый вместе, — у 49 страниц
из 103, это 47,6%. Устаревшие микроданные в любом виде, отдельно или вместе
с ld+json, — у 53 из 103, это 51,5%. То есть более новый
формат встречается у топа реже старого.
А 22 сайта из 103 держат оба формата разом: новый добавили, старый не сняли.
Хоть какая-то разметка есть у 80 страниц из 103 — 77,7%.
Ниши при этом ведут себя очень по-разному, и общая доля 46,6% сглаживает разброс: между крайними нишами разница больше чем втрое. В таблице ниже доли считаются от числа ответивших внутри ниши, и это число стоит в первом столбце в скобках. Адресов в каждой нише после склейки по домену было от 12 до 16, ответивших столько же или меньше.
| Ниша | ld+json | только microdata | Нет ничего |
|---|---|---|---|
| корм для собак (14) | 10 (71,4%) | 2 (14,3%) | 2 (14,3%) |
| пластиковые окна (11) | 7 (63,6%) | 1 (9,1%) | 3 (27,3%) |
| стоматология (14) | 8 (57,1%) | 5 (35,7%) | 1 (7,1%) |
| аренда спецтехники (15) | 7 (46,7%) | 4 (26,7%) | 4 (26,7%) |
| доставка цветов (11) | 5 (45,5%) | 5 (45,5%) | 1 (9,1%) |
| натяжные потолки (15) | 5 (33,3%) | 5 (33,3%) | 4 (26,7%) |
| детская одежда (10) | 3 (30,0%) | 2 (20,0%) | 5 (50,0%) |
| кровельные материалы (13) | 3 (23,1%) | 7 (53,8%) | 3 (23,1%) |
Единственная битая разметка из всей выборки — у натяжных потолков, поэтому
в её строке 5 плюс 5 плюс 4 дают 14, а не 15: пятнадцатый адрес и есть тот
самый неразбираемый блок. У «корма для собак» ld+json стоит
у 71,4% ответивших, у «кровельных материалов» — у 23,1%, и там чаще
встречаются микроданные (53,8%). У «детской одежды» половина ответивших не размечена
вообще никак — и это интернет-магазины, то есть ровно тот случай, где
товарная разметка даёт больше всего.
Где этот замер слаб
Мы читаем исходный HTML, а не отрисованный браузером DOM.
Разметку, которую страница дорисовывает скриптом уже в браузере, наш
инструмент не увидит. Чтобы понять, насколько это занижает цифру 48 из 103,
мы взяли 20 страниц из тех 54, где ld+json не нашлось, — первые
двадцать подряд, без случайного отбора, — и открыли их невидимым браузером
с ожиданием полной отрисовки. Разметка появилась после
скрипта ровно у одной — крупного агрегатора с тяжёлым интерфейсом-приложением,
а не у обычного сайта услуги или магазина. У остальных 19 из 20 разницы нет
никакой: что отдал сервер, то и видит браузер. На всю выборку поправка
добавила бы условно два-три адреса, то есть 46,6% занижены на единицы
процентных пунктов, а не в разы.
Двенадцать адресов не ответили, и мы их не приписали к «разметки нет». Пять отдали 403, один ушёл в таймаут, шесть попали в «иное». Именно поэтому доли считаются от 103, а не от 115: записать молчащий сайт в безразметочные было бы удобно и неверно.
Два домена попали в «иное» из-за защиты нашего же инструмента. Оба адреса разрешаются во внутренний диапазон IP, и проверка отказывается их открывать из соображений безопасности. Это особенность нашего инструмента, а не обязательно признак антибота на их стороне.
Есть и четвёртое, помельче: живой съём выдачи не всегда достаёт все двадцать строк, максимальная зафиксированная позиция в прогоне — 17-я. На склейку по домену и на общий характер результата это не влияет, но выборка чуть меньше номинальных восьми двадцаток.
Что ставить и в каком порядке
Раз общий совет «ставьте разметку под ИИ» первоисточниками не подпирается,
порядок разумнее брать из того, что в топе действительно ставят. Вот какие
типы встретились у 48 страниц с исправным ld+json — одна страница может
объявлять несколько типов сразу, поэтому считаем упоминания.
| Тип | Упоминаний |
|---|---|
BreadcrumbList | 25 |
Organization | 24 |
WebSite | 20 |
WebPage | 14 |
Product | 7 |
LocalBusiness | 6 |
ImageObject | 5 |
MedicalOrganization | 4 |
ItemList | 4 |
FAQPage | 3 |
CollectionPage | 3 |
QAPage | 2 |
OfferCatalog | 2 |
| остальные 12 типов | по 1–2 |
Разметка на практике — это в первую очередь техническая крошка навигации,
визитка компании и опознавание сайта. Товарная и локальная бизнес-разметка
идут только во вторую очередь, хотя именно они дают в выдаче цену, наличие,
рейтинг и адрес. Отсюда и порядок для своего сайта: сначала
BreadcrumbList и Organization — они дешёвые,
ставятся один раз на шаблон и работают на весь сайт. Потом
Product на карточках товара или LocalBusiness
на странице заведения — то, ради чего расширенный сниппет и собирается.
Но самое любопытное в замере не то, каких типов нет, а то, каких полей не
хватает в уже поставленных. Вот что наш инструмент чаще всего не находил
внутри объявленных блоков — по всем 103 ответившим страницам, считая
и ld+json, и микроданные.
| Не хватает поля | Раз |
|---|---|
Organization.sameAs | 25 |
Product.sku | 19 |
Organization.logo | 15 |
Product.brand | 13 |
Product.availability | 10 |
Organization.telephone | 10 |
Organization.address | 8 |
Product.price | 7 |
Product.offers | 7 |
LocalBusiness.geo | 7 |
LocalBusiness.priceRange | 6 |
LocalBusiness.logo | 6 |
BreadcrumbList.name | 6 |
Если перевести имена полей на человеческий, список читается однозначно.
У организации не хватает ссылок на соцсети и агрегаторы
(sameAs), логотипа, телефона и адреса. У товара — артикула
(sku), бренда и наличия (availability), а иногда
и самой цены с блоком предложения. У заведения — координат
(geo), вилки цен и логотипа. То есть чаще всего не хватает
не разметки как таковой, а её обвязки: ровно тех полей, которые связаны
с расширенным сниппетом и карточкой в выдаче, а не с содержанием страницы.
Даже у тех, кто разметку поставил, она недоделана именно в той части, где
от неё есть измеримая польза.
И отдельно про два формата на одной странице. Если у вас, как у тех 22
сайтов из замера, стоят и ld+json, и микроданные разом, стоит
проверить, что две разметки говорят про страницу одно и то же, а не спорят
друг с другом.
Как проверить свою страницу
Пошагового разбора здесь не будет: проверка — дело инструмента, а не текста.
Откройте проверку микроразметки и вставьте
адрес страницы: мы прочитаем исходный HTML, разберём и ld+json,
и микроданные, и скажем, что читается, а что нет. Покажем не только ошибки,
но и чего не хватает для расширенного сниппета. Разметка на каждой странице
своя, поэтому главную и карточку товара стоит проверить по отдельности.
Чего делать не надо
Заводить llms.txt вместо разметки. Та самая
фраза из справки Google перечисляет через запятую и файлы, и разметку:
«You don't need to create new machine readable files, AI text files, or
markup to appear in these features». То есть ни файл вместо разметки, ни
разметка вместо файла в ИИ-ответы не пропуск. У llms.txt своя
польза — это указатель по сайту для ИИ-агента, и
собрать его мы поможем, — но заменой микроразметке
он не является, как и она ему.
Переделывать разметку «под нейросети» в ущерб сниппету. Это самая дорогая ошибка из трёх, потому что меняет работающее на неподтверждённое. Значимого прироста цитирований от JSON-LD открытое измерение Ahrefs не нашло, а про эффект разметки в обычном поиске справка Яндекса говорит прямо. Наш замер добавляет к этому практическую деталь: недоделаны у сайтов ровно сниппетные поля — телефон, адрес, логотип, артикул, бренд, наличие. Начинать стоит с них, а не с придумывания типов, которых словарь под ИИ всё равно не завёл.
Размечать то, чего на странице нет. Ссылки на документ у нас на это правило нет, это наша практика, а не цитата: разметка — подписи к содержимому страницы, и поле, которому на странице ничего не соответствует, ничего не подписывает. Цена в разметке при отсутствии цены на странице, рейтинг без отзывов, адрес заведения у сайта без заведения — всё это обещание, которого страница не выполняет, и посетитель это увидит первым.
Разметку соберём и внедрим за вас — это услуга студии.