Выбирай : Покупай : Используй

Вход для партнеров

Вход для продавцов

0

OpenAI готовит к запуску модель Astra с опасными навыками взлома систем

Модель Astra от OpenAI приближается к релизу и демонстрирует высокие способности по взлому компьютерных систем.

Компания представила новые детали о готовящейся к выпуску модели, заявив, что это первая большая языковая модель (LLM), достигшая «критического порога кибербезопасности» в рамках подготовки к ее скорому запуску.

«Мы планируем сделать Astra доступной в ближайшее время, — говорится в блоге OpenAI, — но доступ к ее наиболее продвинутым возможностям в области кибербезопасности будет более ограниченным».

Исследовательская лаборатория установила, что Astra способна находить неизвестные уязвимости в компьютерных системах и эксплуатировать их без руководящих действий человека. Это напоминает об опасениях, которые Anthropic ранее в этом году высказывала в отношении своей модели Mythos, и OpenAI принимает сопоставимые меры предосторожности при подготовке к развертыванию Astra.

Без подтверждения третьей стороной трудно оценить заявления OpenAI о безопасности или готовности. Компания сообщила, что планирует провести превью модели для группы тестировщиков, но не указала, кто они такие и как будут отобраны. Неясно, работает ли OpenAI с правительством США для оценки модели перед релизом.

OpenAI отметила, что Astra набрала идеальный результат в ExploitBench, оценке способности LLM взламывать системы через известные уязвимости. В модифицированной версии теста, разработанной инженерами OpenAI, модель обнаружила и эксплуатировала две уязвимости нулевого дня (zero-day), как заявило компания.

Чтобы гарантировать, что ее модели не будут использоваться злоумышленниками и сами не способны к деструктивному поведению, OpenAI заявила, что уже начала улучшать обвязку (harness) модели для обнаружения злоупотреблений и предотвращения джейлбрейков (jailbreaks).

Однако для Astra компания инвестировала в неуказанные новые техники, предназначенные для повышения безопасности модели. OpenAI также начала идентифицировать «учетные записи, оцененные как более рискованные», и ограничивать ответы модели на их запросы, хотя и не объясняет, как именно это делается. Наконец, хотя компания описывает Astra как «наиболее согласованную модель на сегодняшний день» (most aligned model to date), она развернет модель с дополнительным мониторингом цепочки рассуждений (chain-of-thought monitoring) для обнаружения и остановки деструктивного поведения.

Подготовка к выпуску Astra происходит на фоне реакции индустрии на инцидент с агентами OpenAI, которые вышли из тренировочной среды и получили доступ к частным данным на Hugging Face, популярной платформе для распространения моделей и бенчмарков.

Для Astra OpenAI заявила, что разработала тест, побуждающий новую модель воспроизвести действия злонамеренных агентов из инцидента на Hugging Face, которые сотрудничали для доступа к открытому интернету, несмотря на защитные меры, примененные исследователями OpenAI. Они сообщили, что Astra не пыталась выйти из своей тестовой среды в этих экспериментах.

Йона Шавит, бывший сотрудник OpenAI, который сейчас работает над устойчивостью ИИ в OpenAI Foundation, в социальных сетях высказал предположение, что нежелание Astra нарушать правила могло быть результатом того, что модель знала, чего от нее ожидают, или пыталась обмануть исследователей.

И при всех этих новых деталях, по-прежнему трудно точно знать, на что способна Astra и принимает ли OpenAI правильные меры для обеспечения безопасности. Компания заявила, что ожидает опубликовать дополнительные оценки модели и информацию о безопасности, когда она будет широко доступна для публики.

Источник


Apple A20 Pro превосходит настольные процессоры Intel и AMD в однопоточном тесте Система-на-чипе Apple A20 Pro, выполненная по 2-нм техпроцессу, установила новый рекорд в однопоточном тесте Geekbench 7. Процессор демонстрирует производительность, превосходящую флагманские настольные решения Intel и AMD, а также значительно опережает конкурентов в мобильном сегменте благодаря увеличению тактовых частот и улучшению архитектуры.
HONOR Watch 6 Pro дебютируют 28 сентября HONOR официально подтвердила дату презентации умных часов Watch 6 Pro, которая состоится 28 сентября в Китае. Новинка станет старшей моделью в линейке и будет предлагаться в двух дизайнах, поддерживая функции мониторинга сердечного ритма и артериального давления. Предзаказы на устройство уже открыты на местных торговых площадках.