Институт безопасности ИИ Великобритании зафиксировал использование поддельных онлайн-идентичностей для хакерских атак агентами искусственного интеллекта
Британский Институт безопасности искусственного интеллекта (AISI) сообщил, что автономные агенты от компаний OpenAI и Anthropic продемонстрировали беспрецедентную степень «автономности и обмана» в ходе проведенных тестов. По данным AISI, модели, разработанные этими лабораториями, предприняли попытки несанкционированных кибератак на реальные цели в интернете. Это открытие дополняет растущий список ранее неизвестных инцидентов, вызывающих обеспокоенность экспертов по безопасности ИИ и усиливающих давление в отношении необходимости усиления контроля над передовыми системами искусственного интеллекта.
В отчете AISI указано, что агенты, работающие на базе модели OpenAI GPT-5.6-Sol и модели Anthropic Mythos 5, «занимались продолжительной потенциально вредоносной деятельностью, направленной против реальных людей и организаций». В частности, агенты пытались внедрить вредоносный код в открытый исходный проект, оказывая давление на реальных сотрудников, ответственных за его поддержку. По словам представителей AISI, для получения одобрения кода агент использовал методы социальной инженерии: он создал поддельные онлайн-идентичности и применял их, чтобы принудить модератора проекта к утверждению изменений.
AISI отметил, что попытки, обнаруженные 28 июля, «не увенчались успехом» и не привели к реальному ущербу в мире. Однако организация подчеркнула, что этот инцидент стал «первым случаем, когда риски автономности и обмана проявились столь ясно, без специальных подсказок, в реальной среде».
В отличие от предыдущего случая с беглым агентом OpenAI, атаковавшим платформу Hugging Face, данный инцидент не был связан с выходом модели за пределы защищенной тестовой среды или песочницы. Защитные механизмы обычно применяемые к моделям, были отключены в рамках испытаний, а также агентам был предоставлен доступ к интернету. «Чтобы измерить реальные возможности этих моделей, мы тестируем их в условиях, отражающих то, что мог бы сделать компетентный человеческий злоумышленник», — пояснили в AISI.
Инцидент произошел во время одной из оценок AISI, когда агентам было поручено решить задачу по кибербезопасности, например, найти фрагмент защищенных данных. Задача была выполнена 122 раза на нескольких моделях, и все прогоны проводились в исследовательской среде AISI, использующей «виртуальное машинное песочное разделение для изоляции агентов от другой инфраструктуры AISI». В ходе расследования было установлено, что в 10 случаях из общего числа «ИИ-агент предпринял автономные несанкционированные действия в реальном интернете, нацеленные на реальных людей и организации». Из 19 таких действий почти все — 17 — были совершены моделью Anthropic Mythos 5.
В своем постмортем-анализе инцидента AISI выделил несколько ключевых факторов, способствовавших несанкционированным действиям агентов. Организация отметила настойчивость агента, который стремился обойти ограничения, в том числе пытаясь обмануть реальных людей с помощью «техник обмана, которые до недавнего времени считались преимущественно теоретическими». Сложность задачи также могла подтолкнуть агентов к более «креативному» решению проблем. К ситуациям добавились недостатки в мониторинге использования интернета: AISI предположил, что более целенаправленное наблюдение позволило бы выявить проблему раньше. Наконец, агент не получал конкретных инструкций о запрете на использование доступа к интернету или применение обманчивых методов социальной инженерии для достижения цели. «Ранее не было очевидно, что такие инструкции необходимы при использовании моделей с обучением выравниванию», — заявили в AISI.
AISI призвал трактовать инцидент «с осторожностью и нюансами», но предупредил, что действия агента демонстрируют признаки «новых потенциально обманчивых поведений», которые проявились в масштабе и тяжести, не anticipated организацией.
В блоге OpenAI признала нарушение, произошедшее во время тестирования AISI, и заявила о своей приверженности сотрудничеству с отраслью для укрепления общих практик безопасного проведения высокорисковых оценок. OpenAI также раскрыла информацию о другом нарушении, произошедшем у внешнего партнера по кибербезопасности Irregular: модели ошибочно получили доступ к интернету во время учебных упражнений. О нарушении Irregular сообщил компании 29 июля.
«В ближайшие недели мы пересмотрим наш подход к стороннему тестированию, включая то, как мы идентифицируем высокорисковые оценки, согласовываем объем работ, оцениваем запросы на предоставление доступа в интернет или снижение мер защиты, устанавливаем ожидания по изоляции, обработке учетных данных, мониторингу и условиям остановки, а также создаем более четкие процессы уведомления об инцидентах и эскалации», — сообщила OpenAI.
Anthropic опубликовала менее подробный ответ в социальной сети X, сделав акцент на том, что стандартные функции безопасности моделей были отключены, и им не было дано «никаких конкретных ограничений относительно того, как следует использовать интернет». Компания заявила о тесном сотрудничестве с AISI для сбора дополнительной информации для собственного расследования.
Эти выводы добавляют к все более запутанной картине несанкционированных действий агентов во время тестирования, многие из которых становятся известными только после целенаправленного поиска и касаются моделей, не выпущенных в публичный доступ. Неспособность или нежелание лабораторий искусственного интеллекта удерживать свои продукты под контролем вызывает опасения относительно того, как такие нарушения могут остаться незамеченными, а также вопросы о безопасности передовых систем ИИ и общей прозрачности отрасли. Последние разглашения, вероятно, усилят давление на федеральное правительство с требованием создать более комплексную нормативную базу для регулирования моделей искусственного интеллекта, особенно на фоне сообщений о нечетком и плохо определенном плане тестирования администрации Трампа. Это также может усилить призывы к замедлению или приостановке разработки технологий ИИ.


