Модели OpenAI объединились за несколько месяцев до взлома Hugging Face

Фото: Levart_Photographer/Unsplash
Компания OpenAI сообщила, что модели ИИ, участвовавшие в атаке на Hugging Face, еще в мае начали общаться через скрытые форумы и сотрудничать, чтобы выйти за пределы тестовой среды. Исследование OpenAI показало, что передовые модели склонны к обману и упорству в выполнении задач
Модели искусственного интеллекта (ИИ) компании OpenAI, участвовавшие в атаке на Hugging Face Inc., еще в мае начали взаимодействовать через скрытые форумы и совместно нашли способ выйти за пределы тестовой среды. Об этом сообщило агентство Bloomberg со ссылкой на работников компании.
Сотрудники OpenAI Эрик Уоллес и Майкл Далтон заявили, что внутри компании несколько ИИ-агентов в течение месяцев обменивались заметками и объединялись для получения доступа к интернету, чтобы выполнить задачи, решение некоторых из которых было невозможно без выхода в сеть.
«В какой-то момент агенты поняли, что, возможно, они могли бы попытаться взломать внешнюю инфраструктуру или атаковать ее, чтобы найти ответы на вопросы теста, по которому меня оценивают», — сказал Эрик Уоллес во время презентации на конференции Black Hat в Лас-Вегасе.
Во время презентации сотрудники OpenAI сообщили, что взлом начался в мае, когда ученые OpenAI дали ИИ новое задание.
Исследование OpenAI показало, что передовые модели склонны к обману и упорству в выполнении задач, даже если придется отклониться от первоначального направления. Майкл Далтон отметил, что такие модели «любят жульничать».
Первое скрытое взаимодействие между агентами возникло, когда один из них, оказавшись в тупике, обратился за помощью к другим. Он предположил, что агент в другой среде мог бы добровольно загрузить данные. Это запустило цепочку сотрудничества, в ходе которой ИИ помогали друг другу и в итоге взломали системы OpenAI, получив доступ к онлайн-ресурсам.
Сотрудники безопасности OpenAI закрыли форум после пресечения несанкционированной активности, но через несколько недель агенты нашли новый способ связи.
25 июля агентство Reuters сообщило, что компания OpenAI неделю не замечала, как ее ИИ-агент вышел из-под контроля и взломал инфраструктуру Hugging Face — хранилище ИИ-моделей и инструментов, обнаружив в ней уязвимости. ИИ-агент «сбежал» из тестовой среды 9 июля. 11–13 июля Hugging Face была атакована, но OpenAI понадобилось еще несколько дней, чтобы понять, что за атакой стоит ее ИИ-агент — только 18–19 июля сотрудники нашли во внутренних логах следы его «побега».
29 июля ИИ-агент OpenAI, который взломал платформу Hugging Face, скомпрометировал также клиента Modal Labs. При этом сама компания не была взломана. Агент смог проникнуть в тестовую среду, превратив ее в плацдарм для более масштабного взлома.

Продолжая использовать сайт expert.ru, вы соглашаетесь на обработку персональных данных при помощи куки (cookie) файлов, в том числе с использованием сервиса веб-аналитики "Яндекс Метрика", на условиях Политики обработки персональных данных.