Почему этот вопрос все чаще звучит от клиентов
Параллельно с ростом GEO у части владельцев сайтов растет и обратный вопрос: а хотим ли мы, чтобы наш контент использовался для обучения чужих моделей или цитировался без явного разрешения? Ответ на этот вопрос — не только юридический, но и стратегический: полный запрет снижает шансы попасть в ответы ИИ вообще.
Что реально можно контролировать через robots.txt
robots.txt позволяет задать отдельные правила для конкретных ботов — например, разрешить PerplexityBot (формирует живые ответы с цитированием) и закрыть GPTBot (используется в том числе для обучения моделей).
за обучение моделей отвечает бот GPTBot, а за поиск внутри ChatGPT — отдельный бот OAI-SearchBot. Это значит, что можно закрыть GPTBot от обучения на вашем контенте и при этом оставить открытым OAI-SearchBot — и видимость в ответах ChatGPT не пострадает. У Perplexity аналогично: PerplexityBot ищет и ссылается на сайты в ответах, а базовые модели на нем, по заявлению самой компании, не обучают. Соблюдение этих правил держится на добросовестности бота, официально декларирующего следование robots.txt.
Технический сигнал ≠ юридическая защита
Запрет через robots.txt сообщает о нежелании, чтобы контент использовался ботом, но не создает юридически обязывающего запрета сам по себе — это скорее отраслевая норма поведения, которую соблюдают крупные официальные краулеры. Для более формальной защиты контента (например, копирайта на конкретные материалы) нужны отдельные юридические механизмы, не связанные с robots.txt.
Разграничение «обучение» и «формирование ответа»
У многих компаний разные боты для разных целей: одни собирают данные для обучения будущих версий модели, другие — для формирования ответа в реальном времени по конкретному запросу пользователя. Закрыв бота первого типа, сайт не обязательно теряет видимость в живых ответах — это разные user-agent с разными именами, которые можно настраивать по отдельности.
Практический выбор для владельца сайта
- Полностью открыть доступ — максимизирует шансы попадания в ответы ИИ, но означает отсутствие контроля над тем, как контент используется дальше;
- Открыть ботов для живых ответов, закрыть для обучения — компромисс: видимость в актуальных ответах при ограничении использования в обучении будущих моделей;
- Полностью закрыть доступ — сознательный отказ от GEO-видимости в пользу максимального контроля над использованием контента.
Выбор зависит от бизнес-модели: для сайта, зарабатывающего на трафике и продажах через видимость, полное закрытие обычно противоречит собственным целям.