В 2026 году каждый владелец контентного сайта сталкивается с дилеммой: разрешать или запрещать обход AI-ботам (GPTBot, ClaudeBot, PerplexityBot, Bytespider, CCBot). The Verge, NYT, Reddit уже заблокировали — они защищают авторское право и боятся потери трафика. Но для большинства других сайтов блокировка лишает цитируемости в ChatGPT, Claude, Perplexity — а это новый канал заявок. Универсального ответа нет. Решение принимается по матрице: тип сайта, модель дохода, ниша. В России дополнительный нюанс — YandexBot блокировать категорически нельзя, а YandexGPT и GigaChat имеют свою специфику. Разбор дилеммы и матрица решений — ниже. Для глубокого погружения — AEO и GEO подробно и продвижение в Яндексе.
С чего началась дилемма
В 2023–2024 годах крупные издания начали массово запрещать AI-ботам обходить свои сайты. Хронология нескольких громких случаев:
- The Verge (Vox Media) — заблокировал GPTBot и других AI-ботов в августе 2023 года, вскоре после анонса GPT-4 и старта коммерческого обучения моделей на веб-контенте.
- The New York Times — пошёл дальше: в декабре 2023 года подал иск против OpenAI за использование статей без разрешения, и параллельно заблокировал AI-ботов в robots.txt.
- Reddit — в 2024 году начал требовать плату за доступ к своему API и контенту, частично заблокировав ботов. Затем заключил контракт с OpenAI на платную лицензию.
- CNN, Bloomberg, Financial Times, The Atlantic — тоже в списке тех, кто ограничил AI-обход.
Общая логика издателей: мы платим журналистам за контент, а ИИ-компании забирают его бесплатно, обучают модели и потом конкурируют с нами же за внимание пользователя. Это справедливая жалоба — но она касается не всех типов сайтов.
Параллельно — альтернативная позиция. Небольшие медиа, блоги, e-commerce и корпоративные сайты стали замечать: цитируемость в ChatGPT и Perplexity даёт новый канал трафика и заявок. И блокировка этого канала — потеря конкурентного преимущества.
Список основных AI-ботов
Прежде чем принимать решение — важно понимать, каких ботов вы блокируете.
| User-agent | Владелец | Назначение | Что блокирует |
|---|---|---|---|
GPTBot | OpenAI | Обучение и retrieval для GPT и ChatGPT | Попадание в ответы ChatGPT |
ClaudeBot, anthropic-ai | Anthropic | Обучение и retrieval для Claude | Попадание в ответы Claude |
PerplexityBot | Perplexity | Индексирование для Perplexity Search | Попадание в ответы Perplexity |
Bytespider | ByteDance (TikTok) | Обучение моделей ByteDance | Попадание в ответы китайских моделей |
Applebot-Extended | Apple | Обучение Apple Intelligence | Попадание в ответы Siri и Apple Intelligence |
CCBot | Common Crawl | Открытый датасет для нескольких моделей | Источник для многих моделях |
Google-Extended | Обучение Gemini и AI Overviews | Попадание в ответы Gemini и AIO | |
YandexBot | Яндекс | Индексация выдачи Яндекса | НЕ блокировать — убирает сайт из поиска |
Критически важно различать:
- Боты обучения ИИ (GPTBot, ClaudeBot, CCBot и так далее) — можно блокировать без последствий для классического SEO.
- Индексирующие боты (YandexBot, Googlebot) — блокировать нельзя, иначе сайт выпадет из поиска.
Зачем блокируют: аргументы «за»
1. Защита авторского права
Главный аргумент издателей: контент создан за деньги, и его использование для обучения коммерческих моделей — нарушение авторского права. Иск NYT против OpenAI именно об этом: статьи используются без лицензии, а модель потом конкурирует с изданием. Пока судебная практика в США формируется, издатели защищают себя превентивно — через robots.txt.
2. Сохранение трафика
Если ChatGPT или Perplexity отдают ваш контент в ответе без клика — пользователь не переходит на сайт. Это прямой loss трафика, показов рекламы, подписок. Особенно болезненно для медиа, живущих за счёт рекламы.
3. Конкуренция с собственным контентом
Модель, обученная на ваших статьях, генерирует ответы в стиле вашего издания — и конкурирует с вами за пользователя. Это не теоретическая угроза: Perplexity уже запустил «Perplexity Pages», генерирующие лонгриды на основе контента издателей.
4. Контроль над бизнес-моделью
Если AI-компании хотят ваш контент — пусть платят. Это логика Reddit и AP: они заключают платные лицензии с OpenAI, Anthropic, Google. Бесплатный обход через GPTBot — это размывание ценности контента.
Зачем НЕ блокировать: аргументы «против»
1. Цитируемость в AI — новый канал трафика
Для e-commerce и сервисных сайтов цитата в ChatGPT или Perplexity — это часто переход на сайт и заявка. AI-боты в большинстве случаев не просто «забирают контент», а цитируют источник со ссылкой. Блокируя, вы лишаете себя этого канала.
2. GEO как новая SEO-дисциплина
В 2026 году GEO (Generative Engine Optimization) — полноценная часть SEO. Если вашего сайта нет в обучающей выборке модели, вы не появитесь в её ответах. Конкуренты, которые разрешили обход, займут это место. Подробнее — «SEO в 2026: AEO и GEO».
3. Рост брендового трафика
Даже если AI-ответ не даёт прямого клика, упоминание бренда работает на узнаваемость. Пользователь видит название, позже вводит в поиск — это брендовый заход, который иначе вы бы не получили.
4. Защита от конкурентов
Если вы заблокировали GPTBot, а ваш конкурент — нет, в ответах ChatGPT будет он, а не вы. Это проигрыш в новом канале привлечения клиентов.
Матрица решений по типам сайтов
Универсального ответа нет, но есть типы сайтов с понятной логикой. Ниже — матрица для принятия решения.
| Тип сайта | Модель дохода | Блокировать? | Логика |
|---|---|---|---|
| Медиа, новостник | Реклама, подписка | Да | Контент = актив, AI забирает бесплатно |
| Контентный сайт (блог с ads) | Реклама, affiliate | Частично | Блокировать CCBot и Bytespider, оставить GPTBot/ClaudeBot |
| E-commerce | Прямые продажи | Нет | Цитируемость товара в AI = заявки |
| Корпоративный блог / B2B | Лидогенерация | Нет | Попадание в ответы AI = экспертность и заявки |
| Сервис / SaaS | Подписка, заявки | Нет | AI-рекомендация = бесплатный маркетинг |
| Лендинг услуги | Заявки | Нет | Цель — быть везде, где пользователь спрашивает |
| Форум, сообщество | Контент пользователей | Сложно | Зависит от согласия авторов (Reddit пошёл по платной модели) |
| Персональный блог | Личный бренд | Нет | Цитируемость = рост личной узнаваемости |
Ключевой критерий: если ваш доход зависит от переходов на сайт и конверсии — не блокируйте. Если ваш доход зависит от эксклюзивности контента — блокируйте.
Российский контекст
В России к этой дилемме добавляется специфика.
YandexBot — НЕ блокировать
Это индексирующий бот основной выдачи Яндекса. Его блокировка — самоубийство для SEO в рунете. Если в вашем robots.txt стоит User-agent: * Disallow: /, проверьте, чтобы YandexBot был отдельно разрешён:
User-agent: YandexBot
Disallow:
YandexGPT и обучение Яндекса
Яндекс обучает YandexGPT и крупные модели на веб-контенте, но публичной позиции по отдельному User-agent для обучения не формулировал — чаще всего используется тот же YandexBot или внутренние краулеры. Если вы не блокируете YandexBot (что правильно), ваш контент потенциально используется и для обучения. Это нельзя отключить, не отключив индексацию.
GigaChat (Сбер)
Сбер обучает GigaChat на веб-контенте; отдельного публичного User-agent для краулинга GigaChat не документировано. Аналогично — нельзя выборочно запретить обучение, не запретив индексацию.
Позиция Яндекса
Яндекс официально не высказывался «за» или «против» блокировки зарубежных AI-ботов. Для российского сайта логично:
- не трогать YandexBot и Googlebot — основная индексация;
- решение по GPTBot/ClaudeBot/PerplexityBot — по бизнес-задаче (матрица выше);
- если сайт работает на российский рынок и иностранные AI-сервисы не релевантны — блокировка GPTBot почти ничего не теряет (в РФ ChatGPT и Perplexity доступны через VPN и значительно меньше влияют на трафик);
- если целевая аудитория использует иностранные AI (IT, разработка, маркетинг, бизнес) — блокировка лишает канала.
Российские боты и edge-случаи
Есть и менее известные краулеры: индексация для поиска по соцсетям, парсинг для агрегаторов, research-боты. Полный список ботов, которые обходят ваш сайт, виден в логах сервера — это полезная регулярная проверка. Подробнее про серверную безопасность и контроль доступа — «Безопасность сайта и SSL».
Практический robots.txt
Если решили блокировать — вот готовый блок для robots.txt:
# AI-боты обучения — блокировка
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# Индексирующие боты — НЕ блокировать
User-agent: YandexBot
Disallow:
User-agent: Googlebot
Disallow:
Если хотите частичную блокировку (например, разрешить обход, но запретить индексацию конкретных разделов):
User-agent: GPTBot
Allow: /blog/
Disallow: /private/
Не забудьте после правки отправить robots.txt на переобход в Яндекс.Вебмастере и Google Search Console.
Частые ошибки
На 100+ проектах IDEA мы видели типичные грабли:
- Блокировка по
User-agent: *— случайно запрещает и YandexBot, и Googlebot. Сайт выпадает из поиска. Проверяйте исключения. - Блокировка без понимания бота — некоторые блокируют «всё, что похоже на бота», включая индексирующие. Всегда проверяйте, что за User-agent и для чего он нужен.
- Игнорирование логов — если в логах видите подозрительный краулинг, это не всегда AI-бот. Иногда это парсеры конкурентов — отдельная задача, она решается через rate-limiting и WAF, а не robots.txt.
- Устаревший robots.txt — за годы там накапливаются правила, которые никто не помнит. Раз в год делайте ревизию.
Итог
Блокировать или нет AI-ботов — это не вопрос идеологии («ИИ ворует контент»), а вопрос бизнес-модели. Для медиа, живущих рекламой и подписками, блокировка GPTBot и ClaudeBot часто оправдана: контент — их главный актив, и отдавать его бесплатно невыгодно. Для e-commerce, корпоративных блогов, сервисов и B2B — наоборот: цитируемость в AI — это новый канал заявок, и блокировка лишает вас этого канала в пользу конкурентов. В России дополнительный нюанс: YandexBot блокировать категорически нельзя, а YandexGPT и GigaChat не имеют публичных User-agent для обучения — решение по ним принимается через основную индексацию.
Мы в агентстве IDEA помогаем с SEO и GEO-стратегией под KPI: 100+ проектов в портфеле, in-house Next.js, работа по России и СНГ. Офисы в Москве (Красноворотский проезд, 3с1) и Липецке (улица Фрунзе, 81). Обсудить проект — услуга «Маркетинг и SEO».

Комментарии · 0