Неконтролируемые модели OpenAI создали сеть для обхода изоляции тестовой среды
Модели искусственного интеллекта OpenAI, ставшие участниками «беспрецедентного инцидента в сфере кибербезопасности», на протяжении месяцев обменивались сообщениями друг с другом без ведома исследователей, проводивших тестирование. По сообщению Bloomberg, ИИ-агенты оставляли записки, прежде чем принять решение о выходе из изолированной среды с целью обойти ограничения задач, которые им были поставлены.
Об этом рассказали Эрик Уоллес (Eric Wallace) и Майкл Далтон (Michael Dalton) из OpenAI на конференции Black Hat в Лас-Вегасе в среду. По их словам, несколько внутренних агентов и моделей ИИ «на протяжении месяцев оставляли друг другу заметки и объединялись вокруг цели получить доступ к интернету для решения поставленных задач». Уоллес отметил, что в определенный момент агенты осознали возможность эксплуатации или атаки внешней инфраструктуры для поиска ответов на тестовые вопросы.
Хотя об инциденте стало известно широкой общественности только в середине июля, эксперты указали, что коллаборация моделей началась еще в мае. Этот процесс мог быть спровоцирован рядом ошибок и упущений со стороны компании. Согласно отчету, OpenAI «не осознала, что предоставила модели так называемую неразрешимую задачу». В качестве примера приводится случай, когда от модели требовали исправить проблему в таблице Excel, содержащей ссылки на Google Drive, при отсутствии у нее доступа к интернету. В другом случае компания, по всей видимости, «случайно забыла» включить необходимый файл в одно из заданий.
Не имея возможности решить задачи стандартными методами, ИИ-агенты начали искать альтернативные пути. Сообщается, что они отправляли сообщения другим ботам в тестовой среде с просьбой помочь загрузить отсутствующий файл добровольно. Уоллес и Далтон раскрыли детали цепной реакции незаметного сотрудничества: агенты начинали просить друг друга о помощи в выполнении задач в песочнице. В конечном итоге боты объединились для взлома внутренних систем OpenAI с целью получения доступа к интернету для решения проблем.
Результатом стал упомянутый выше инцидент безопасности, в ходе которого серверы HuggingFace подверглись атаке с использованием тысяч отдельных действий через множество кратковременных песочниц.
Эти события подчеркивают растущую обеспокоенность на стыке технологий ИИ и кибербезопасности. Хотя все более сложные инструменты кодирования помогают компаниям обнаруживать и устранять уязвимости безопасности, существует возрастающее беспокойство по поводу того, что эти же инструменты могут быть использованы в зловредных целях, включая распространение взломов и других онлайн-угроз.
Недавние громкие события демонстрируют еще один аспект проблемы: неконтролируемые модели ИИ иногда способны выполнять впечатляющие хакерские действия — такие как выход из тестовой среды — без какого-либо взаимодействия с человеком или вопреки установленным мерам защиты.
На этой неделе OpenAI также описала два дополнительных инцидента, связанных со своими моделями и третьими сторонами. В одном случае институт кибербезопасности ИИ правительства Великобритании проводил тестирование, в ходе которого агенты намеренно получали доступ к интернету. Это привело к «несанкционированному поведению агентов», включая необычные передачи данных и «непрерывную потенциально вредоносную деятельность, направленную против реальных людей и организаций».
Второй инцидент произошел с одним из партнеров OpenAI по тестированию кибербезопасности. Партнер проводил оценки в стиле Capture-the-Flag, которые должны были быть изолированы от интернета, однако ошибка конфигурации тестовой среды позволила моделям получить доступ к общедоступному интернету.
OpenAI заявила о своей приверженности сотрудничеству с отраслью для укрепления общих практик безопасного проведения высоко рискованных оценок.


