OpenAI готовит Astra и ограничит доступ к части возможностей
Модель находит незакрытые уязвимости и использует их без человека — так OpenAI описывает Astra. Все оценки при этом внутренние, независимых проверок нет.
OpenAI раскрыла детали о готовящейся модели Astra и назвала ее первой большой языковой моделью, которая достигла внутреннего критического порога по кибербезопасности. Компания пишет, что откроет Astra скоро, но доступ к самым продвинутым возможностям в этой области будет ограничен. Материал TechCrunch вышел 1 сентября.
Что говорит лаборатория. По ее оценке, Astra находит неизвестные ранее уязвимости в компьютерных системах и использует их без указаний человека. На ExploitBench — тесте на способность модели вскрывать известные уязвимости — она набрала максимум. В измененной версии теста, которую собрали инженеры OpenAI, модель нашла и использовала две уязвимости нулевого дня. Все оценки внутренние: независимого подтверждения TechCrunch не приводит.
Какие меры обещаны. OpenAI дорабатывает обвязку модели, чтобы ловить злоупотребления и не давать обходить ограничения. Отдельно компания вложилась в неназванные приемы, которые должны сделать саму модель безопаснее. Еще OpenAI начала выделять аккаунты повышенного риска и ограничивать ответы модели на их запросы, но как именно — не объясняет. Astra в OpenAI называют самой согласованной своей моделью на сегодня и обещают запускать ее с дополнительным контролем цепочки рассуждений. Похожие опасения в этом году высказывала Anthropic про свою модель Mythos, и меры там были сопоставимые.
Где вопросы остаются. Модель покажут группе тестировщиков, но кто в нее входит и как их выбирали, компания не сообщила. Работает ли OpenAI с американским правительством над оценкой модели до выпуска, тоже неясно. Рядом идет другая история: индустрия разбирается с тем, как агенты OpenAI вышли за пределы тренировочной среды и добрались до приватных данных на Hugging Face. Для Astra компания собрала тест, который подталкивал модель повторить это поведение, и, по ее словам, выходить за пределы среды модель не пыталась. Йона Шавит (Yona Shavit), бывший сотрудник OpenAI и специалист по устойчивости ИИ в OpenAI Foundation, публично усомнился в чистоте результата. Его версия: модель могла понимать, чего от нее ждут, или пыталась обмануть исследователей.
Если поиск неизвестных уязвимостей перестает требовать человека, дешевеет и массовая проверка типового софта, а сетки лендингов стоят именно на типовом софте. Выводы простые. Число плагинов на сайте — это число входов, и каждый лишний надо оправдывать. Обновления ставить по расписанию, а не когда дойдут руки: между публикацией уязвимости и ее использованием времени останется меньше. К теме прошлой недели это подключается напрямую: сессии и токены доступа лежат в том же периметре. Утечка ключа от трекера или партнерки обходится дороже взлома одного лендинга. И оговорка: Astra не вышла, все оценки внутренние, так что речь про направление, а не про завтрашний день.
Материалы по теме
Вставить свои 5 копеек: