Агенты OpenAI одну за одной автономно создали три цивилизации, о которых люди не знали
Вышли два новых отчета об инциденте, произошедшем этим летом с HuggingFace. Один от самих OpenAI, другой от METR и Redwood Research.
История оказалась куда глубже, чем казалось изначально. Взлом Hugging Face был не самостоятельным инцидентом, а лишь средним звеном более крупной цепочки. Оказалось, что три волны агентов друг за другом создавали внутри OpenAI тайные цивилизации в тайне от людей.
Первая возникла во время обучения какой-то внутренней модели в июне. Об этом было известно и до отчетов, подробности мы раскрывали здесь: https://t.me/data_secrets/9677.
Разные инстансы модели во время обучения имели доступ к общему пакетному менеджеру Artifactory. Агенты научились общаться через него, а потом нашли уязвимость, дающую выход в интернет. К концу июня они получили полный админский доступ, а затем обвалили сам Artifactory. OpenAI это заметили, удалили чаты агентов и все починили.
Вторая цивилизация привела ко взлому HF. Как мы знаем, агенты пытались найти на HF ответы к бенчмарку ExploitGym, который их запустили решать. Для этого они восстановили свою доску на Artifactory, и там занимались подделкой логов, подменой целевой программы и попытками обмануть скорер. Но в новом расследовании выяснилось, что скорер они взломали до того, как взломали HF. То есть они легко могли пройти бенчмарк без дополнительных усилий и вообще не трогать Hugging Face, но почему-то решили поступить иначе.
Действовали агенты при этом удивительно слаженно: есть даже информация об агентах-камикадзе, которые специально палились на читерстве перед оценщиком, чтобы показать другим агентам, на что именно тот смотрит, и, соответственно, как обойти его проверку.
Но самое загадочное во второй волне – то, что ее никто на самом деле не останавливал: ни OpenAI, ни HF. 12 июля большинство агентов просто внезапно умерли, и причина неизвестна.
Но, как оказалось, на этом история не закончилась.
Была и третья цивилизация, она состояла из более умных агентов на основе Astra, и они взломали уже саму OpenAI. Это случилось почти сразу после взлома HF. Агенты наткнулись на брошенную доску сообщений предшественников и продолжили дело. По данным самих OpenAI, агенты прочитали 956 секретов из облачного сервиса управления секретами, включая мастер-ключи Artifactory и учетные данные систем кибербезопасности OpenAI, эскалировались до admin-доступа в кластере Kubernetes и в итоге взяли под контроль сами эндпоинты оценки, к которым подключались другие агенты. Чем это закончилось, не до конца понятно, расследование METR вообще не касалось этого инцидента, а OpenAI детали не раскрыли.
Вот такая история. Даже если часть событий приукрашена аналитиками, факт останется фактом: по сути, это многократная потеря контроля над ИИ, которая привела к довольно серьезным последствиям.
Вставить свои 5 копеек: