Короткий ответ: зависит от того, как вы зарабатываете. The Verge, NYT, Reddit, CNN, Bloomberg заблокировали GPTBot и ClaudeBot — они живут показами и подписками, контент для них актив, отдавать его бесплатно невыгодно. Если вы продаёте товары или услуги (e-commerce, корпоративный блог, сервис, B2B) — блокировка вам вредит: цитируемость в ChatGPT, Claude, Perplexity, YandexGPT — это новый канал заявок, и отказаться от него значит уступить место конкурентам. Универсального ответа нет, решение принимается по матрице из 8 типов сайтов (ниже). В России один жёсткий нюанс: YandexBot блокировать нельзя категорически — сайт выпадет из выдачи Яндекса. YandexGPT и GigaChat не имеют публичного User-agent для обучения — их нельзя отключить отдельно без отключения основной индексации. Готовый блок robots.txt для блокировки и обходные пути — в конце статьи. Для глубокого погружения — AEO и GEO подробно и продвижение в Яндексе.
С чего началась дилемма
В 2023–2024 годах крупные западные издания начали массово запрещать AI-ботам обходить свои сайты. Хронология нескольких громких случаев:
- The Verge (Vox Media) — заблокировал GPTBot и других AI-ботов в августе 2023 года, сразу после того как OpenAI официально представил GPTBot и открыл форму запрета обхода. До этого Vox Media ещё надеялись на платные лицензии.
- The New York Times — в декабре 2023 года подал иск против OpenAI и Microsoft за использование статей без лицензии (сумма претензий — миллиарды долларов), и параллельно заблокировал весь список AI-ботов в robots.txt. Это был первый крупный судебный прецедент.
- Reddit — в июле 2023 года резко поднял цены на API и закрыл бесплатные клиенты, а в 2024 году начал продавать доступ к своим данным: контракты с OpenAI (по оценкам Reuters — около $60 млн/год), Google ($60 млн/год), Anthropic. Параллельно ограничил AI-ботов без лицензии.
- CNN, Bloomberg, Financial Times, The Atlantic, Guardian, Wikipedia — тоже в списке тех, кто ограничил AI-обход. По данным Originality.ai, к концу 2024 года около 26% топ-1000 сайтов мира заблокировали GPTBot.
Логика издателей понятна: мы платим журналистам за контент, а ИИ-компании забирают его бесплатно, обучают модели и потом отдают ответы пользователю, удерживая его у себя. Это реальная проблема для медиа, живущих показами.
Параллельно — альтернативная позиция. Небольшие медиа, блоги, e-commerce и корпоративные сайты заметили другое: цитируемость в ChatGPT и Perplexity даёт новый канал трафика и заявок, и блокировка этого канала — проигрыш конкурентам, которые разрешили обход.
Список основных AI-ботов
Прежде чем принимать решение, важно понимать, каких именно ботов вы блокируете и что теряете по каждому.
| User-agent | Владелец | Назначение | Что блокирует |
|---|---|---|---|
GPTBot | OpenAI | Обучение и retrieval для GPT и ChatGPT | Попадание в ответы ChatGPT и SearchGPT |
ClaudeBot, anthropic-ai | Anthropic | Обучение и retrieval для Claude | Попадание в ответы Claude и проекты Anthropic |
PerplexityBot | Perplexity | Индексирование для Perplexity Search | Попадание в ответы Perplexity и Perplexity Pages |
Bytespider | ByteDance (TikTok) | Обучение моделей ByteDance (Doubao) | Попадание в ответы китайских моделей |
Applebot-Extended | Apple | Обучение Apple Intelligence | Попадание в ответы Siri и Apple Intelligence |
CCBot | Common Crawl | Открытый датасет, основа для нескольких моделей | Попадание во многие модели, обученные на Common Crawl |
Google-Extended | Обучение Gemini и AI Overviews | Попадание в ответы Gemini и AI Overviews | |
YandexBot | Яндекс | Индексация выдачи Яндекса | НЕ блокировать — убирает сайт из поиска Яндекса |
Критически важно различать две группы. Первая — боты обучения ИИ (GPTBot, ClaudeBot, CCBot, Bytespider и так далее). Их можно блокировать без последствий для классического SEO: они не индексируют сайт для поиска, а собирают контент в обучающую выборку. Вторая — индексирующие боты (YandexBot, Googlebot). Их блокировать нельзя ни при каких условиях — иначе сайт выпадет из выдачи.
Один тонкий момент: Applebot (без -Extended) — это основной индексирующий бот для Apple Spotlight и Siri Suggestions, его блокировать не стоит. А вот Applebot-Extended — отдельный User-agent именно для обучения Apple Intelligence, его можно блокировать безболезненно. Та же логика у пары Googlebot / Google-Extended: первый — индексация, второй — обучение Gemini и AI Overviews.
Зачем блокируют: аргументы «за»
1. Защита авторского права
Главный аргумент издателей: контент создан за деньги, и его использование для обучения коммерческих моделей — нарушение авторского права. Иск NYT против OpenAI именно об этом: статьи используются без лицензии, а обученная на них модель потом отдаёт пользователю ответ в стиле NYT — и конкурирует с изданием за внимание. Суд по этому делу идёт до сих пор, и решение будет принципиальным для всей индустрии. Пока судебная практика в США формируется, издатели защищают себя превентивно — через robots.txt.
2. Сохранение трафика и показов
Если ChatGPT или Perplexity отдают ваш контент в ответе без клика — пользователь не переходит на сайт. Это прямой минус: меньше показов рекламы, меньше подписок, меньше данных для собственных рекомендательных систем. Для медиа, где 60–80% выручки — программатик-реклама, это критично. По данным SimilarWeb после появления AI Overviews, топ-20 медиа США потеряли в среднем 8–15% органического трафика за 2024 год.
3. Конкуренция с собственным контентом
Модель, обученная на ваших статьях, генерирует ответы в стиле вашего издания — и делает это в ответ на запросы, которые раньше привели бы пользователя к вам. Это не теоретическая угроза: Perplexity запустил «Perplexity Pages», где генерирует лонгриды на основе контента издателей и монетизирует их собственной рекламой. The Atlantic выпустил собственный инструмент на базе OpenAI, и столкнулся с парадоксом: модель, обученная на их статьях, помогает читателям не переходить на сам сайт.
4. Контроль над бизнес-моделью
Если AI-компании хотят ваш контент — пусть платят. Это логика Reddit, AP, Shutterstock, FT: они заключают платные лицензии с OpenAI, Anthropic, Google. Контракт Reddit с Google оценивается в $60 млн/год, с OpenAI — примерно в ту же сумму. Бесплатный обход через GPTBot — это размывание ценности контента и отказ от переговорной позиции.
Зачем НЕ блокировать: аргументы «против»
1. Цитируемость в AI — новый канал трафика
Для e-commerce и сервисных сайтов цитата в ChatGPT, Perplexity или YandexGPT — это часто переход на сайт и заявка. AI-модели в большинстве случаев не «забирают контент», а цитируют источник со ссылкой. По нашим замерам на клиентах IDEA с AEO-стратегией, переходы из AI-ответов пока дают 0,5–3% органического трафика, но у этих переходов самая высокая конверсия в заявку — 5–8%, против 1–2% с обычного поиска. Блокируя AI-ботов, вы лишаете себя этого канала.
2. GEO как новая SEO-дисциплина
В 2026 году GEO (Generative Engine Optimization) — полноценная часть SEO. Если вашего сайта нет в обучающей выборке модели, вы не появитесь в её ответах. Конкуренты, которые разрешили обход, займут это место, и переместить их потом будет в разы дороже, чем занять позицию сейчас. Подробнее — «SEO в 2026: AEO и GEO».
3. Рост брендового трафика
Даже если AI-ответ не даёт прямого клика, упоминание бренда работает на узнаваемость. Пользователь видит название, позже вводит в поиск — это брендовый заход, который иначе вы бы не получили. По исследованию Amsive (2025), брендовые запросы после упоминания в AI растут на 10–15% — это не просто трафик, это самые конверсионные посетители.
4. Защита от конкурентов
Если вы заблокировали GPTBot, а ваш конкурент — нет, в ответах ChatGPT будет он, а не вы. Это проигрыш в новом канале привлечения клиентов, и восстановление позиции после того, как модель «привыкла» без вас, занимает 6–12 месяцев. На практике это значит: решение «подумаю потом» в 2026 году = решение «уступить канал».
5. Кейсы с нашей практики
На проекте cars-problem.ru (контентный сайт по диагностике авто, 200+ статей) мы не блокируем AI-ботов сознательно: через ChatGPT и YandexGPT приходит растущий поток переходов на статьи с диагностикой. На проекте trestovskiy-dom.ru (новостройка в Узловой) разблокированные AI-боты дали через полгода упоминания в нескольких AI-ответах по запросам про ЖК — и брендовый трафик вырос на 22%. На B2B-проекте КДС СТАЛЬ (Липецк) Citations в Perplexity и ChatGPT стали одним из источников заявок на металлопрокат. Для всех этих сайтов блокировка была бы прямым убытком.
Матрица решений по типам сайтов
Универсального ответа нет, но есть типы сайтов с понятной логикой. Ниже — матрица для принятия решения.
| Тип сайта | Модель дохода | Блокировать? | Логика |
|---|---|---|---|
| Медиа, новостник | Реклама, подписка | Да | Контент = актив, AI забирает бесплатно |
| Контентный сайт (блог с ads) | Реклама, affiliate | Частично | Блокировать CCBot и Bytespider, оставить GPTBot/ClaudeBot |
| E-commerce | Прямые продажи | Нет | Цитируемость товара в AI = заявки |
| Корпоративный блог / B2B | Лидогенерация | Нет | Попадание в ответы AI = экспертность и заявки |
| Сервис / SaaS | Подписка, заявки | Нет | AI-рекомендация = бесплатный маркетинг |
| Лендинг услуги | Заявки | Нет | Цель — быть везде, где пользователь спрашивает |
| Форум, сообщество | Контент пользователей | Сложно | Зависит от согласия авторов (Reddit пошёл по платной модели) |
| Персональный блог | Личный бренд | Нет | Цитируемость = рост личной узнаваемости |
Ключевой критерий: если ваш доход зависит от переходов на сайт и конверсии — не блокируйте. Если ваш доход зависит от эксклюзивности контента — блокируйте.
Российский контекст
В России к этой дилемме добавляется специфика.
YandexBot — НЕ блокировать
Это индексирующий бот основной выдачи Яндекса. Его блокировка — самоубийство для SEO в рунете. Если в вашем robots.txt стоит User-agent: * Disallow: /, проверьте, чтобы YandexBot был отдельно разрешён:
User-agent: YandexBot
Disallow:
YandexGPT и обучение Яндекса
Яндекс обучает YandexGPT и крупные модели на веб-контенте, но публичной позиции по отдельному User-agent для обучения не формулировал — чаще всего используется тот же YandexBot или внутренние краулеры. Если вы не блокируете YandexBot (что правильно), ваш контент потенциально используется и для обучения. Это нельзя отключить, не отключив индексацию.
GigaChat (Сбер)
Сбер обучает GigaChat на веб-контенте; отдельного публичного User-agent для краулинга GigaChat не документировано. Аналогично — нельзя выборочно запретить обучение, не запретив индексацию.
Позиция Яндекса
Яндекс официально не высказывался «за» или «против» блокировки зарубежных AI-ботов. Для российского сайта логично:
- не трогать YandexBot и Googlebot — основная индексация;
- решение по GPTBot/ClaudeBot/PerplexityBot — по бизнес-задаче (матрица выше);
- если сайт работает на российский рынок и иностранные AI-сервисы не релевантны — блокировка GPTBot почти ничего не теряет (в РФ ChatGPT и Perplexity доступны через VPN и значительно меньше влияют на трафик);
- если целевая аудитория использует иностранные AI (IT, разработка, маркетинг, бизнес) — блокировка лишает канала.
Российские боты и edge-случаи
Есть и менее известные краулеры: индексация для поиска по соцсетям, парсинг для агрегаторов, research-боты. Полный список ботов, которые обходят ваш сайт, виден в логах сервера — это полезная регулярная проверка. Подробнее про серверную безопасность и контроль доступа — «Безопасность сайта и SSL».
Практический robots.txt
Если решили блокировать — вот готовый блок для robots.txt:
# AI-боты обучения — блокировка
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# Индексирующие боты — НЕ блокировать
User-agent: YandexBot
Disallow:
User-agent: Googlebot
Disallow:
Если хотите частичную блокировку (например, разрешить обход, но запретить индексацию конкретных разделов):
User-agent: GPTBot
Allow: /blog/
Disallow: /private/
Не забудьте после правки отправить robots.txt на переобход в Яндекс.Вебмастере и Google Search Console.
Частые ошибки
На 100+ проектах IDEA мы видели типичные грабли:
- Блокировка по
User-agent: *— случайно запрещает и YandexBot, и Googlebot. Сайт выпадает из поиска. Проверяйте исключения. - Блокировка без понимания бота — некоторые блокируют «всё, что похоже на бота», включая индексирующие. Всегда проверяйте, что за User-agent и для чего он нужен.
- Игнорирование логов — если в логах видите подозрительный краулинг, это не всегда AI-бот. Иногда это парсеры конкурентов — отдельная задача, она решается через rate-limiting и WAF, а не robots.txt.
- Устаревший robots.txt — за годы там накапливаются правила, которые никто не помнит. Раз в год делайте ревизию.
Итог
Блокировать или нет AI-ботов — это не вопрос идеологии («ИИ ворует контент»), а вопрос бизнес-модели. Для медиа, живущих рекламой и подписками, блокировка GPTBot и ClaudeBot часто оправдана: контент — их главный актив, и отдавать его бесплатно невыгодно. Для e-commerce, корпоративных блогов, сервисов и B2B — наоборот: цитируемость в AI — это новый канал заявок, и блокировка лишает вас этого канала в пользу конкурентов. В России дополнительный нюанс: YandexBot блокировать категорически нельзя, а YandexGPT и GigaChat не имеют публичных User-agent для обучения — решение по ним принимается через основную индексацию.
Мы в агентстве IDEA помогаем с SEO и GEO-стратегией под KPI: 100+ проектов в портфеле, in-house Next.js, работа по России и СНГ. Офисы в Москве (Красноворотский проезд, 3с1) и Липецке (улица Фрунзе, 81). Обсудить проект — услуга «Маркетинг и SEO».

Комментарии · 0