📈 Маркетинг

Блокировать ли AI-ботов в robots.txt: дилемма издателя 2026

The Verge, NYT и Reddit блокируют GPTBot и ClaudeBot. Разбираем, кому выгодно запрещать обход AI-ботам, кому это вредит, и даём матрицу решений для медиа, e-commerce, корпоративных блогов и контент-сайтов.

🚫
Короткий ответ

В 2026 году каждый владелец контентного сайта сталкивается с дилеммой: разрешать или запрещать обход AI-ботам (GPTBot, ClaudeBot, PerplexityBot, Bytespider, CCBot). The Verge, NYT, Reddit уже заблокировали — они защищают авторское право и боятся потери трафика. Но для большинства других сайтов блокировка лишает цитируемости в ChatGPT, Claude, Perplexity — а это новый канал заявок. Универсального ответа нет. Решение принимается по матрице: тип сайта, модель дохода, ниша. В России дополнительный нюанс — YandexBot блокировать категорически нельзя, а YandexGPT и GigaChat имеют свою специфику. Разбор дилеммы и матрица решений — ниже. Для глубокого погружения — AEO и GEO подробно и продвижение в Яндексе.

С чего началась дилемма

В 2023–2024 годах крупные издания начали массово запрещать AI-ботам обходить свои сайты. Хронология нескольких громких случаев:

  • The Verge (Vox Media) — заблокировал GPTBot и других AI-ботов в августе 2023 года, вскоре после анонса GPT-4 и старта коммерческого обучения моделей на веб-контенте.
  • The New York Times — пошёл дальше: в декабре 2023 года подал иск против OpenAI за использование статей без разрешения, и параллельно заблокировал AI-ботов в robots.txt.
  • Reddit — в 2024 году начал требовать плату за доступ к своему API и контенту, частично заблокировав ботов. Затем заключил контракт с OpenAI на платную лицензию.
  • CNN, Bloomberg, Financial Times, The Atlantic — тоже в списке тех, кто ограничил AI-обход.

Общая логика издателей: мы платим журналистам за контент, а ИИ-компании забирают его бесплатно, обучают модели и потом конкурируют с нами же за внимание пользователя. Это справедливая жалоба — но она касается не всех типов сайтов.

Параллельно — альтернативная позиция. Небольшие медиа, блоги, e-commerce и корпоративные сайты стали замечать: цитируемость в ChatGPT и Perplexity даёт новый канал трафика и заявок. И блокировка этого канала — потеря конкурентного преимущества.

Список основных AI-ботов

Прежде чем принимать решение — важно понимать, каких ботов вы блокируете.

User-agentВладелецНазначениеЧто блокирует
GPTBotOpenAIОбучение и retrieval для GPT и ChatGPTПопадание в ответы ChatGPT
ClaudeBot, anthropic-aiAnthropicОбучение и retrieval для ClaudeПопадание в ответы Claude
PerplexityBotPerplexityИндексирование для Perplexity SearchПопадание в ответы Perplexity
BytespiderByteDance (TikTok)Обучение моделей ByteDanceПопадание в ответы китайских моделей
Applebot-ExtendedAppleОбучение Apple IntelligenceПопадание в ответы Siri и Apple Intelligence
CCBotCommon CrawlОткрытый датасет для нескольких моделейИсточник для многих моделях
Google-ExtendedGoogleОбучение Gemini и AI OverviewsПопадание в ответы Gemini и AIO
YandexBotЯндексИндексация выдачи ЯндексаНЕ блокировать — убирает сайт из поиска

Критически важно различать:

  • Боты обучения ИИ (GPTBot, ClaudeBot, CCBot и так далее) — можно блокировать без последствий для классического SEO.
  • Индексирующие боты (YandexBot, Googlebot) — блокировать нельзя, иначе сайт выпадет из поиска.

Зачем блокируют: аргументы «за»

1. Защита авторского права

Главный аргумент издателей: контент создан за деньги, и его использование для обучения коммерческих моделей — нарушение авторского права. Иск NYT против OpenAI именно об этом: статьи используются без лицензии, а модель потом конкурирует с изданием. Пока судебная практика в США формируется, издатели защищают себя превентивно — через robots.txt.

2. Сохранение трафика

Если ChatGPT или Perplexity отдают ваш контент в ответе без клика — пользователь не переходит на сайт. Это прямой loss трафика, показов рекламы, подписок. Особенно болезненно для медиа, живущих за счёт рекламы.

3. Конкуренция с собственным контентом

Модель, обученная на ваших статьях, генерирует ответы в стиле вашего издания — и конкурирует с вами за пользователя. Это не теоретическая угроза: Perplexity уже запустил «Perplexity Pages», генерирующие лонгриды на основе контента издателей.

4. Контроль над бизнес-моделью

Если AI-компании хотят ваш контент — пусть платят. Это логика Reddit и AP: они заключают платные лицензии с OpenAI, Anthropic, Google. Бесплатный обход через GPTBot — это размывание ценности контента.

Зачем НЕ блокировать: аргументы «против»

1. Цитируемость в AI — новый канал трафика

Для e-commerce и сервисных сайтов цитата в ChatGPT или Perplexity — это часто переход на сайт и заявка. AI-боты в большинстве случаев не просто «забирают контент», а цитируют источник со ссылкой. Блокируя, вы лишаете себя этого канала.

2. GEO как новая SEO-дисциплина

В 2026 году GEO (Generative Engine Optimization) — полноценная часть SEO. Если вашего сайта нет в обучающей выборке модели, вы не появитесь в её ответах. Конкуренты, которые разрешили обход, займут это место. Подробнее — «SEO в 2026: AEO и GEO».

3. Рост брендового трафика

Даже если AI-ответ не даёт прямого клика, упоминание бренда работает на узнаваемость. Пользователь видит название, позже вводит в поиск — это брендовый заход, который иначе вы бы не получили.

4. Защита от конкурентов

Если вы заблокировали GPTBot, а ваш конкурент — нет, в ответах ChatGPT будет он, а не вы. Это проигрыш в новом канале привлечения клиентов.

Матрица решений по типам сайтов

Универсального ответа нет, но есть типы сайтов с понятной логикой. Ниже — матрица для принятия решения.

Тип сайтаМодель доходаБлокировать?Логика
Медиа, новостникРеклама, подпискаДаКонтент = актив, AI забирает бесплатно
Контентный сайт (блог с ads)Реклама, affiliateЧастичноБлокировать CCBot и Bytespider, оставить GPTBot/ClaudeBot
E-commerceПрямые продажиНетЦитируемость товара в AI = заявки
Корпоративный блог / B2BЛидогенерацияНетПопадание в ответы AI = экспертность и заявки
Сервис / SaaSПодписка, заявкиНетAI-рекомендация = бесплатный маркетинг
Лендинг услугиЗаявкиНетЦель — быть везде, где пользователь спрашивает
Форум, сообществоКонтент пользователейСложноЗависит от согласия авторов (Reddit пошёл по платной модели)
Персональный блогЛичный брендНетЦитируемость = рост личной узнаваемости

Ключевой критерий: если ваш доход зависит от переходов на сайт и конверсии — не блокируйте. Если ваш доход зависит от эксклюзивности контента — блокируйте.

Российский контекст

В России к этой дилемме добавляется специфика.

YandexBot — НЕ блокировать

Это индексирующий бот основной выдачи Яндекса. Его блокировка — самоубийство для SEO в рунете. Если в вашем robots.txt стоит User-agent: * Disallow: /, проверьте, чтобы YandexBot был отдельно разрешён:

User-agent: YandexBot
Disallow:

YandexGPT и обучение Яндекса

Яндекс обучает YandexGPT и крупные модели на веб-контенте, но публичной позиции по отдельному User-agent для обучения не формулировал — чаще всего используется тот же YandexBot или внутренние краулеры. Если вы не блокируете YandexBot (что правильно), ваш контент потенциально используется и для обучения. Это нельзя отключить, не отключив индексацию.

GigaChat (Сбер)

Сбер обучает GigaChat на веб-контенте; отдельного публичного User-agent для краулинга GigaChat не документировано. Аналогично — нельзя выборочно запретить обучение, не запретив индексацию.

Позиция Яндекса

Яндекс официально не высказывался «за» или «против» блокировки зарубежных AI-ботов. Для российского сайта логично:

  • не трогать YandexBot и Googlebot — основная индексация;
  • решение по GPTBot/ClaudeBot/PerplexityBot — по бизнес-задаче (матрица выше);
  • если сайт работает на российский рынок и иностранные AI-сервисы не релевантны — блокировка GPTBot почти ничего не теряет (в РФ ChatGPT и Perplexity доступны через VPN и значительно меньше влияют на трафик);
  • если целевая аудитория использует иностранные AI (IT, разработка, маркетинг, бизнес) — блокировка лишает канала.

Российские боты и edge-случаи

Есть и менее известные краулеры: индексация для поиска по соцсетям, парсинг для агрегаторов, research-боты. Полный список ботов, которые обходят ваш сайт, виден в логах сервера — это полезная регулярная проверка. Подробнее про серверную безопасность и контроль доступа — «Безопасность сайта и SSL».

Практический robots.txt

Если решили блокировать — вот готовый блок для robots.txt:

# AI-боты обучения — блокировка
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# Индексирующие боты — НЕ блокировать
User-agent: YandexBot
Disallow:

User-agent: Googlebot
Disallow:

Если хотите частичную блокировку (например, разрешить обход, но запретить индексацию конкретных разделов):

User-agent: GPTBot
Allow: /blog/
Disallow: /private/

Не забудьте после правки отправить robots.txt на переобход в Яндекс.Вебмастере и Google Search Console.

Частые ошибки

На 100+ проектах IDEA мы видели типичные грабли:

  1. Блокировка по User-agent: * — случайно запрещает и YandexBot, и Googlebot. Сайт выпадает из поиска. Проверяйте исключения.
  2. Блокировка без понимания бота — некоторые блокируют «всё, что похоже на бота», включая индексирующие. Всегда проверяйте, что за User-agent и для чего он нужен.
  3. Игнорирование логов — если в логах видите подозрительный краулинг, это не всегда AI-бот. Иногда это парсеры конкурентов — отдельная задача, она решается через rate-limiting и WAF, а не robots.txt.
  4. Устаревший robots.txt — за годы там накапливаются правила, которые никто не помнит. Раз в год делайте ревизию.

Итог

Блокировать или нет AI-ботов — это не вопрос идеологии («ИИ ворует контент»), а вопрос бизнес-модели. Для медиа, живущих рекламой и подписками, блокировка GPTBot и ClaudeBot часто оправдана: контент — их главный актив, и отдавать его бесплатно невыгодно. Для e-commerce, корпоративных блогов, сервисов и B2B — наоборот: цитируемость в AI — это новый канал заявок, и блокировка лишает вас этого канала в пользу конкурентов. В России дополнительный нюанс: YandexBot блокировать категорически нельзя, а YandexGPT и GigaChat не имеют публичных User-agent для обучения — решение по ним принимается через основную индексацию.

Мы в агентстве IDEA помогаем с SEO и GEO-стратегией под KPI: 100+ проектов в портфеле, in-house Next.js, работа по России и СНГ. Офисы в Москве (Красноворотский проезд, 3с1) и Липецке (улица Фрунзе, 81). Обсудить проект — услуга «Маркетинг и SEO».

Частые вопросы

Нужно ли блокировать AI-ботов в robots.txt?
Зависит от типа сайта. Медиа и контентные сайты, живущие за счёт показов и подписок, часто блокируют GPTBot и ClaudeBot — чтобы ИИ не забирал контент без выгоды для источника. E-commerce, корпоративные блоги и сервисные сайты, наоборот, выигрывают от цитируемости в AI — им блокировка вредит. Универсального ответа нет, решение принимается по матрице.
Каких AI-ботов блокируют чаще всего?
Основные боты обучения и индексации ИИ: GPTBot (OpenAI), ClaudeBot и anthropic-ai (Anthropic), PerplexityBot, Bytespider (ByteDance), Applebot-Extended (Apple AI), CCBot (Common Crawl, используется для обучения нескольких моделей). YandexBot блокировать НЕ нужно — это индексирующий бот Яндекса, его запрет уберёт сайт из поиска.
Что будет, если заблокировать GPTBot и ClaudeBot?
Сайт перестанет использоваться как источник обучения для соответствующих моделей. В краткосрочной перспективе трафик не пострадает — на классическое SEO блокировка не влияет. Но вы теряете шанс попадать в ответы ChatGPT, Claude и Perplexity как цитируемый источник.
Влияет ли блокировка AI-ботов на SEO в Яндексе и Google?
Нет, напрямую не влияет. GPTBot, ClaudeBot, PerplexityBot — отдельные от основных индексирующих ботов (Googlebot, YandexBot) User-agent. Блокируя AI-ботов, вы не запрещаете основную индексацию.
Какова позиция Яндекса по AI-краулингу?
Яндекс разделяет индексирующий обход (YandexBot) и обучение YandexGPT. Публичной позиции по блокировке зарубежных AI-ботов Яндекс не высказывал. Для российского сайта логично: не блокировать YandexBot ни при каких условиях, а решение по GPTBot/ClaudeBot принимать по бизнес-задаче.
Стоит ли блокировать AI-ботов медиа-сайту?
Часто — да. Если модель дохода — показы рекламы и подписки, AI-ответ, который отдаёт ваш контент без перехода на сайт, режет трафик и доход. Именно поэтому The Verge, NYT, Reddit частично или полностью блокируют AI-ботов.
Как заблокировать AI-ботов в robots.txt?
Списком User-agent и правилом Disallow. Пример: User-agent: GPTBot / Disallow: / — блокирует обход для OpenAI. Аналогично для ClaudeBot, PerplexityBot, Bytespider, Applebot-Extended, CCBot. YandexBot и Googlebot не трогайте.
Что делать российскому сайту?
Если сайт продаёт товары или услуги — не блокируйте AI-ботов: цитируемость в ChatGPT и YandexGPT даёт заявки. Если это медиа или контентный проект с доходом от рекламы — рассмотрите блокировку. И в любом случае не блокируйте YandexBot — это убьёт ваше SEO в Яндексе.
Оцените материал:
0

Остались вопросы? Поможем

Эксперты IDEA ответят по теме материала или подскажут по вашему проекту. Свяжемся в течение дня, без навязывания.

Комментарии · 0