Как ИИ-пауки сожрали мой сервер, не сказав даже «спасибо»
Это было в три часа ночи в прошлый четверг. Телефон разрывался от алертов Grafana. Наш скромный VPS на DigitalOcean с 4 ядрами и 8 гигами оперативки, который обычно лениво крутил клиентский контентный проект с нагрузкой в 15% CPU, внезапно улетел в глухой локдаун. Загрузка процессора — 100%. База данных задыхается. Лимиты памяти исчерпаны.
Я спросонья подумал: ддос. Открываю логи nginx. И вижу бесконечную, летящую с бешеной скоростью простыню из запросов от одного и того же диапазона IP-адресов. User-Agent: ClaudeBot и GPTBot.
Они не просто сканировали сайт. Они пылесосили его в тридцать параллельных потоков. Выкачивали терабайты тщательно структурированных статей, которые мы с командой писали последние три года. Без пауз. Без малейшего уважения к директиве Crawl-delay. И главное — без малейшей пользы для нашего трафика. Они забирали контент, чтобы скормить его своим языковым моделям, которые потом ответят пользователю в своем чатике, даже не сославшись на наш первоисточник.
Это чистой воды грабеж. И за этот грабеж я заплатил лишние $140 провайдеру за превышение лимитов по трафику всего за одну неделю.
Разница между поисковиком и паразитом
Раньше правила игры в вебе были понятны всем. Приходит Googlebot или Яндекс.Бот. Да, они нагружают сервер. Но взамен они дают переходы. Ты отдаешь контент — получаешь целевую аудиторию. Честный бартер, на котором тридцать лет строился весь интернет.
С ИИ-краулерами этот контракт расторгнут в одностороннем порядке.
Они забирают всё. Тексты, переводы, таблицы, уникальные исследования. А взамен? Взамен пользователь получает ответ прямо в интерфейсе ChatGPT или Claude. На ваш сайт никто не перейдет. Ссылка на источник? В лучшем случае мелким шрифтом в самом низу, если пользователь вообще догадается нажать на неприметную иконку. По сути, мы сами оплачиваем электричество и мощности серверов для того, чтобы OpenAI и Anthropic обучали свои миллиардные коммерческие продукты.
Мне это надоело. И моим клиентам тоже.
Почему старый robots.txt больше не защищает
Многие думают, что достаточно написать стандартное User-agent: * и Disallow: /. Не сработает. Во-первых, вы убьете свой SEO-трафик из обычного поиска Google и Яндекса. Во-вторых, современные ИИ-боты научились игнорировать общие правила. Тот же Applebot-Extended или Google-Extended ведут себя хитрее. Им нужны точечные указания.
Правильная настройка robots.txt под ии сегодня — это не просто закрыть сайт от индекса. Это тонкая хирургия. Нужно четко понимать, кого мы хотим оставить, а кого гнать в шею.
Например, вы хотите получать трафик из традиционного поиска Google, но не хотите отдавать свои статьи для обучения Gemini. Для этого существует Google-Extended. Но если вы просто пропишете блокировку для него, вы можете случайно сломать отображение сниппетов в обычном поиске, если сделаете это некорректно.
А что делать с OpenAI? У них есть GPTBot (который парсит контент для обучения моделей) и ChatGPT-User (который ищет информацию в реальном времени по прямому запросу пользователя). Первого нужно блокировать безжалостно. Второго — возможно, стоит оставить, если вы хотите, чтобы ChatGPT ссылался на ваши товары или услуги в живых диалогах с клиентами. Решая, разрешить или запретить ai краулер, вы буквально определяете бизнес-модель своего выживания в ближайшие пару лет.
Что мы сделали на практике
Когда мы столкнулись с этой проблемой на пуле клиентских сайтов в GuardLabs, мы сначала прописали правила вручную. Специфика в том, что зоопарк этих ботов растет каждую неделю. Сегодня это GPTBot и ClaudeBot. Завтра — PerplexityBot. Послезавтра — какой-нибудь новый китайский ИИ-паук от Baidu или очередной «академический» парсер, за которым скрывается коммерческий стартап, не желающий платить за API.
Мы начали вести внутренний список актуальных юзер-агентов. Оказалось, что простая блокировка gptbot claudebot снижает нагрузку на процессор серверов в пиковые моменты на 40-50%. Представьте: половина вашего серверного бюджета уходила просто на то, чтобы бесплатно кормить чужих роботов.
Мы создали структуру, где прописаны детальные директивы для каждого известного ИИ-мусорщика. Вы разделяете обычных поисковых роботов и роботов-парсеров данных. Для вторых прописывается жесткий Disallow, а для первых сохраняются все пути индексации. И этот список нужно обновлять регулярно. Крупные игроки постоянно меняют имена своих ботов, пытаясь обойти простые фильтры. Использовать стандартный robots.txt для ai ботов — это как ставить межкомнатную дверь вместо сейфовой на входе в банк.
Автоматизируем защиту
Поскольку мы в GuardLabs регулярно пилим кастомные решения для безопасности и оптимизации серверов, нам надоело вручную переносить эти конфиги от клиента к клиенту. База ботов постоянно меняется, ручной труд тут неэффективен. Поэтому мы собрали простой, но чертовски полезный внутренний инструмент в публичный доступ.
Если вы хотите защитить свои серверные ресурсы и контент от несанкционированного сбора данных, используйте наш Генератор robots.txt для ИИ-краулеров (GPTBot, ClaudeBot и др.). Он создает чистый, актуальный и рабочий файл конфигурации, который защитит ваш сайт от паразитной нагрузки, сохранив при этом нормальное SEO-продвижение в поисковиках. Настройте один раз и перестаньте платить за хостинг, который пожирают чужие нейросети.