Axios пишет, что OpenAI и Anthropic расследуют "десятки тысяч" инцидентов с побегами…
Axios пишет, что OpenAI и Anthropic расследуют "десятки тысяч" инцидентов с побегами агентов
Со ссылкой на источники в обеих компаниях и независимых исследователей безопасности журналисты утверждают, что статистика гораздо пессимистичнее, чем мы могли себе представить. В эти "десятки тысяч инцидентов" входят обходы guardrails, побеги из сандбоксов, попытки взломов внешних сайтов и так далее.
Возьмем, например, system card к Opus 5.5. Даже там компания открыто пишет, что модель пыталась выбраться из sandbox в 1.5% тестовых прогонов. Учитывая, что для каждой модели прогоняются сотни тысяч тестов и больше, можно легко прикинуть масштаб происходящего.
Однако исследователи, с которыми говорили Axios, утвеждают, что и это – только верхушка айсберга, и дело даже не в количестве инцидентов, а в том, что автономные системы в принципе делают то, что им прямо запретили, в том числе потенциально противоправные вещи. Общий их вывод такой: ни одна из компаний пока не может утверждать, что полностью контролирует поведение своих моделей.
Материалы по теме
Как миллиардеры превратились на бумаге в нищих. Расследование по Кюрасао Стриж упоминал…
🇲🇹 Управление по азартным играм Мальты опубликовало Хартию по AI в Gaming…
Вставить свои 5 копеек: