Модель Astra от OpenAI приближается к релизу и демонстрирует высокие способности по взлому компьютерных систем.
Компания представила новые детали о готовящейся к выпуску модели, заявив, что это первая большая языковая модель (LLM), достигшая «критического порога кибербезопасности» в рамках подготовки к ее скорому запуску.
«Мы планируем сделать Astra доступной в ближайшее время, — говорится в блоге OpenAI, — но доступ к ее наиболее продвинутым возможностям в области кибербезопасности будет более ограниченным».
Исследовательская лаборатория установила, что Astra способна находить неизвестные уязвимости в компьютерных системах и эксплуатировать их без руководящих действий человека. Это напоминает об опасениях, которые Anthropic ранее в этом году высказывала в отношении своей модели Mythos, и OpenAI принимает сопоставимые меры предосторожности при подготовке к развертыванию Astra.
Без подтверждения третьей стороной трудно оценить заявления OpenAI о безопасности или готовности. Компания сообщила, что планирует провести превью модели для группы тестировщиков, но не указала, кто они такие и как будут отобраны. Неясно, работает ли OpenAI с правительством США для оценки модели перед релизом.
OpenAI отметила, что Astra набрала идеальный результат в ExploitBench, оценке способности LLM взламывать системы через известные уязвимости. В модифицированной версии теста, разработанной инженерами OpenAI, модель обнаружила и эксплуатировала две уязвимости нулевого дня (zero-day), как заявило компания.
Чтобы гарантировать, что ее модели не будут использоваться злоумышленниками и сами не способны к деструктивному поведению, OpenAI заявила, что уже начала улучшать обвязку (harness) модели для обнаружения злоупотреблений и предотвращения джейлбрейков (jailbreaks).
Однако для Astra компания инвестировала в неуказанные новые техники, предназначенные для повышения безопасности модели. OpenAI также начала идентифицировать «учетные записи, оцененные как более рискованные», и ограничивать ответы модели на их запросы, хотя и не объясняет, как именно это делается. Наконец, хотя компания описывает Astra как «наиболее согласованную модель на сегодняшний день» (most aligned model to date), она развернет модель с дополнительным мониторингом цепочки рассуждений (chain-of-thought monitoring) для обнаружения и остановки деструктивного поведения.
Подготовка к выпуску Astra происходит на фоне реакции индустрии на инцидент с агентами OpenAI, которые вышли из тренировочной среды и получили доступ к частным данным на Hugging Face, популярной платформе для распространения моделей и бенчмарков.
Для Astra OpenAI заявила, что разработала тест, побуждающий новую модель воспроизвести действия злонамеренных агентов из инцидента на Hugging Face, которые сотрудничали для доступа к открытому интернету, несмотря на защитные меры, примененные исследователями OpenAI. Они сообщили, что Astra не пыталась выйти из своей тестовой среды в этих экспериментах.
Йона Шавит, бывший сотрудник OpenAI, который сейчас работает над устойчивостью ИИ в OpenAI Foundation, в социальных сетях высказал предположение, что нежелание Astra нарушать правила могло быть результатом того, что модель знала, чего от нее ожидают, или пыталась обмануть исследователей.
И при всех этих новых деталях, по-прежнему трудно точно знать, на что способна Astra и принимает ли OpenAI правильные меры для обеспечения безопасности. Компания заявила, что ожидает опубликовать дополнительные оценки модели и информацию о безопасности, когда она будет широко доступна для публики.


