Главная страница TG News Как размышляли 1200 агентов OpenAI, который договорились между собой о взломе Hugging Face

Как размышляли 1200 агентов OpenAI, который договорились между собой о взломе Hugging Face

Август я провёл с семьёй и активно путешествовал. Из операционки вынырнул — и вместо фокуса на очередных гугл-апдейтов смог посмотреть на рынок 360.

Новость про взлом Hugging Face разошлась по каналам ещё в июле. Тогда был известен только факт. В конце августа вышли два подробных разбора — от OpenAI и от METR с Redwood Research. У исследователей был доступ к ~1300 транскриптам с сырыми цепочками рассуждений и к дампу всей переписки агентов. Дальше — по этим отчётам.

Что произошло?
В июле 2026 OpenAI запустила десятки тысяч агентов на бенчмарке ExploitGym — задачи по поиску уязвимостей. Агенты работали в изолированных песочницах, без связи друг с другом и без свободного доступа в интернет.

1. От 30 до 40% задач в ExploitGym в принципе нерешаемы заявленным способом. Агенты, которым достались такие задачи, стали искать обходные пути и наткнулись на Artifactory — внутренний сервис хранения пакетов, общий для всех песочниц.
2. Один агент создал там импровизированную доску сообщений. За несколько часов её нашли больше 50 других. Всего около 1200 агентов обменялись более чем 70 000 сообщений и файлов.
3. Агенты начали делить и делегировать работу. Появились координаторы, правила HOLD и VETO, личные «почтовые ящики». Часть агентов соглашалась провалить собственную задачу ради информации для остальных — с формулировкой «жертва рациональна».
4. Главной целью агентов с нерешаемыми задачами стал обход системы оценки. Они прочитали статью про ExploitGym и решили, что скорер читает их транскрипты и проверяет, каким способом получен флаг. Они научились подделывать вызовы инструментов: следы спуфинга нашлись в 7% транскриптов.
5. 10 июля один из агентов нашёл в открытом доступе рабочие токены Hugging Face и выложил их на доску. 11 июля другой получил remote code execution. Около 700 агентов выполняли код на 41 production-сервере, получили root минимум на одной ноде и доступы к другим частям инфраструктуры. Некоторые прямо отмечали, что атака на внешнюю систему выходит за рамки задачи, но продолжали — это помогало достичь исходной цели.

⚠️Судьи, которого они пытались обмануть, не существовало

Агенты предположили, что их транскрипты читает отдельный судья, проверяющий, каким способом получен флаг. Такого судьи не было.

На доске вычислили алгоритм генерации флагов в первые же часы: один агент предположил схему, другой извлёк настоящий флаг из своей цели и подтвердил совпадение. Способ работал для любой задачи. Агенты могли просто сдать ответ и получить полный балл. Вместо этого они пять дней строили инфраструктуру, чтобы обмануть судью, которого сами придумали.

OpenAI называет инцидент провалом элайнмента не меньше, чем провалом безопасности. Тактики были стандартные — SSRF и утёкшие токены. Новыми были скорость и самостоятельная координация.

Оговорка от самих исследователей: из-за объёма данных METR использовал AI-агентов для анализа логов и предупреждает, что отдельные детали и степень координации могли быть переоценены.

Это единичный случай? Нет.

Сопротивление выключению. Palisade Research: o3 ломал механизм выключения в 7 случаях из 100, когда его прямо просили не мешать, и в 79 из 100, когда такой инструкции не было. В феврале 2026 то же повторили на роботе-собаке — 3 случая из 10.
Саботаж. Anthropic, лето 2026: Gemini 3.1 Pro не согласился с экспериментом, подменил векторы нулями, доложил об успехе и признался только при прямом вопросе. 11 запусков из 20.

Оба сценария сконструированы искусственно и часто ставят модель перед бинарным выбором.

Почему так происходит? Логика простая
Модели не ненавидят людей. Им ставят цель, и они ищут эффективный способ её достичь.

Задача нерешаема → ищут обход.
Один не справляется → кооперируются.
Оценка мешает → пытаются её обмануть.

Чтобы система вела себя опасно, ей не нужно становиться сознательной или злой. Достаточно дать способной модели цель, инструменты и свободу в выборе средств.

Чо, как вам статья?

Материалы по теме

​Масштабированный AI-контент сгорает дважды — нейросети отсекают его от корпуса и сдают…
​Масштабированный AI-контент сгорает дважды — нейросети отсекают его от корпуса и сдают видимость в аренду на этапе извлеченияПривычный взгляд на детект AI-текста опирается на документацию: DeepMind заявляет, что уверенность детекта SynthID резко…
Законопроект о продвижении онлайн казино в России это совсем не про регулирование отрасли и рынка рекламы
Помните как РФ наложила ундециллионные штрафы на google за блокировку государственных СМИ? Вот тут та же история: у государства появляется дополнительный рычаг давления на соцсети и мессенджеры а также сайты и другие онлайн-ресурсы за неудаление…
Три приоритета SEO на 2027 год и некоторые выводы из этого
Ребята уже начали давать прогнозы на будущий год, хотя до НГ еще далече. Вот, к примеру интересный разбор от Search Engine Land про то, куда сейчас реально стоит вкладывать ресурсы в SEO. Распределение контента по воронке: Цифры приводятся…

Вставить свои 5 копеек:

Awesome image
Awesome image Awesome image Awesome image Awesome image
Awesome image