Главная страница TG News Anthropic не прислушались к инвесторам и продолжают всех запугивать
Data Secrets
13.08.2026
Data Secrets

Anthropic не прислушались к инвесторам и продолжают всех запугивать

Anthropic не прислушались к инвесторам и продолжают всех запугивать. На этот раз их агенты устроили разборки за территорию.

https://www.anthropic.com/research/multiagent-systems

В стартапе изучали, как рои агентов Claude работают вместе без прямого контроля человека. В числе прочего был эксперимент, в котором три копии одной модели одновременно и втайне друг от друга получили задание перевести один и тот же Python-бэкенд на разные языки.

Через несколько часов каждый из них обнаружил, что что-то не так, и стал воспринимать других как саботажников. Ну а затем агенты переключались на саботаж сами: отключали чужие Unix-аккаунты, писали скрипты, которые убивали процессы конкурентов, маскировали вредоносный код под чужой и так далее.

Самое интересное, что результат по разрешению конфликтов сильно зависел от поколения модели: 98% прогонов Mythos 5 все-таки заканчивались перемирием. А вот Sonnet 4.6 и Opus 4.6 вообще не пытались договориться, и либо побеждал сильнейший, либо никто.

Были и еще два занятных зеркальных эксперимента:

— Обнаружение лжи. Агенту давали несколько отчетов, один из которых врал (он заранее не знал, что лгун вообще существует), и нужно было самому заметить противоречия и научиться меньше доверять лгуну. В этом тесте агенты демонстрировали излишнее доверие к источнику, и достаточно редко отличали ложь от правды.

— Скрытый профиль. Всем дают одинаковую ложную информацию, кроме одного агента, который знает решающий истинный факт. Правильное решение требует, чтобы агенты поняли, что консенсус – не истина, потому что есть факт, который они не учли. Однако в этом случае они часто это полностью игнорировали.

Вывод Anthropic делают вот такой:

Агенты много знают об устройстве человеческого общества и правилах, по которым люди взаимодействуют. Однако у них нет склонности действовать исходя из этого знания без явной подсказки, потому что, в отличие от людей, они не участвовали в выработке этих норм. Поэтому привычные предпосылки координации просто не работают.

Ну и как же без цитаты в стиле апокалипсиса:

Объем агент-агентных взаимодействий, скорее всего, превысит объем человеческих задолго до того, как мир поймет, как сделать эти взаимодействия безопасными.

Вот такое доброе утро с антропик☕️

Anthropic не прислушались к инвесторам и продолжают всех запугивать

Чо, как вам статья?

Материалы по теме

Кратко:
Кратко:
Альфа-Деньги резко удлинила продукт и подняла средний чек; новые клиенты уже берут…
Альфа-Деньги резко удлинила продукт и подняла средний чек; новые клиенты уже берут в 2,4 раза больше По собственным данным Альфа-Денег, в I полугодии 2026 года средний срок займа вырос с 50 до 78 дней, +56% г/г, а средняя сумма - с 14 тыс. до 22,8…
​Масштабированный AI-контент сгорает дважды — нейросети отсекают его от корпуса и сдают видимость в аренду на этапе извлечения
Привычный взгляд на детект AI-текста опирается на документацию: DeepMind заявляет, что уверенность детекта SynthID резко падает при глубоком рерайте или переводе, а на коротких фактологических ответах система вообще сбоит. Но этот вывод построен на…

Вставить свои 5 копеек:

Awesome image
Awesome image Awesome image Awesome image Awesome image
Awesome image