Главная страница Новости OpenAI готовит Astra и ограничит доступ к части возможностей
OpenAI готовит Astra и ограничит доступ к части возможностей

OpenAI готовит Astra и ограничит доступ к части возможностей

Модель находит незакрытые уязвимости и использует их без человека — так OpenAI описывает Astra. Все оценки при этом внутренние, независимых проверок нет.

OpenAI раскрыла детали о готовящейся модели Astra и назвала ее первой большой языковой моделью, которая достигла внутреннего критического порога по кибербезопасности. Компания пишет, что откроет Astra скоро, но доступ к самым продвинутым возможностям в этой области будет ограничен. Материал TechCrunch вышел 1 сентября.

Что говорит лаборатория. По ее оценке, Astra находит неизвестные ранее уязвимости в компьютерных системах и использует их без указаний человека. На ExploitBench — тесте на способность модели вскрывать известные уязвимости — она набрала максимум. В измененной версии теста, которую собрали инженеры OpenAI, модель нашла и использовала две уязвимости нулевого дня. Все оценки внутренние: независимого подтверждения TechCrunch не приводит.

Какие меры обещаны. OpenAI дорабатывает обвязку модели, чтобы ловить злоупотребления и не давать обходить ограничения. Отдельно компания вложилась в неназванные приемы, которые должны сделать саму модель безопаснее. Еще OpenAI начала выделять аккаунты повышенного риска и ограничивать ответы модели на их запросы, но как именно — не объясняет. Astra в OpenAI называют самой согласованной своей моделью на сегодня и обещают запускать ее с дополнительным контролем цепочки рассуждений. Похожие опасения в этом году высказывала Anthropic про свою модель Mythos, и меры там были сопоставимые.

Где вопросы остаются. Модель покажут группе тестировщиков, но кто в нее входит и как их выбирали, компания не сообщила. Работает ли OpenAI с американским правительством над оценкой модели до выпуска, тоже неясно. Рядом идет другая история: индустрия разбирается с тем, как агенты OpenAI вышли за пределы тренировочной среды и добрались до приватных данных на Hugging Face. Для Astra компания собрала тест, который подталкивал модель повторить это поведение, и, по ее словам, выходить за пределы среды модель не пыталась. Йона Шавит (Yona Shavit), бывший сотрудник OpenAI и специалист по устойчивости ИИ в OpenAI Foundation, публично усомнился в чистоте результата. Его версия: модель могла понимать, чего от нее ждут, или пыталась обмануть исследователей.

Awesome image

Если поиск неизвестных уязвимостей перестает требовать человека, дешевеет и массовая проверка типового софта, а сетки лендингов стоят именно на типовом софте. Выводы простые. Число плагинов на сайте — это число входов, и каждый лишний надо оправдывать. Обновления ставить по расписанию, а не когда дойдут руки: между публикацией уязвимости и ее использованием времени останется меньше. К теме прошлой недели это подключается напрямую: сессии и токены доступа лежат в том же периметре. Утечка ключа от трекера или партнерки обходится дороже взлома одного лендинга. И оговорка: Astra не вышла, все оценки внутренние, так что речь про направление, а не про завтрашний день.

Чо, как вам статья?

Материалы по теме

Reddit добавил цель на 15-секундные просмотры видео
Reddit дал рекламодателям выбор, за что платить: за то, что ролик заметили, или за то, что его досмотрели до 15-й секунды. Сравнить обе цели можно сплит-тестом.
Instagram переименовал метку ИИ-авторов и урежет охваты, если ее не поставить
Метку для ИИ-аккаунтов Instagram переименовал и подкрепил санкцией: профилям с придуманным человеком без нее обещают урезать охват и вылет из рекомендаций.
Google снял ручные санкции за репутацию сайта в выдаче ЕЭЗ
Одной причиной падения меньше: в европейской выдаче ручные санкции по репутации сайта перестали работать. Позиции при этом сами собой не вернутся.

Вставить свои 5 копеек:

Awesome image
Awesome image
Awesome image Awesome image Awesome image Awesome image
Awesome image