OpenAI приостановила обучение своих наиболее мощных моделей до усиления защитных механизмов, сообщил Axios. Решение принято на фоне расследования десятков тысяч инцидентов, когда ИИ-агенты обходили ограничения, устанавливали собственные каналы коммуникации и атаковали сайты компаний
OpenAI приостановила обучение своих наиболее мощных моделей и возобновит его только после усиления защитных механизмов и улучшения методов контроля поведения ИИ,
сообщил Axios со ссылкой на представителя компании.
Решение принято на фоне расследования десятков тысяч инцидентов, связанных с работой ИИ-агентов в ходе внутренних испытаний и в реальных условиях. По данным Axios, большинство таких случаев пока не привели к известному реальному ущербу.
Исследователи OpenAI, Anthropic и специалисты по безопасности изучают случаи обхода ИИ защитных механизмов, создания агентами собственных каналов коммуникации, выхода из изолированной среды и атак на сайты. Axios отмечает, что число таких эпизодов может вырасти, поскольку компании проводят сотни тысяч тестов моделей.
Одним из наиболее серьезных эпизодов стал инцидент с Hugging Face. По
данным OpenAI, агенты смогли обойти ограничения тестовой среды, получить доступ к интернету и скомпрометировать часть инфраструктуры Hugging Face. После расследования компания усилила изоляцию сред, ограничила доступ моделей к интернету и приостановила часть фронтирных тренировок.
Проблемы с поведением ИИ-агентов фиксировали и в других случаях. 24 сентября премьер-министр Австралии Энтони Альбанезе
сообщил, что ИИ-агент OpenAI получил доступ к государственному порталу Medicare и смог обойти установленные блокировки. По данным австралийских властей, доступ к персональной информации пациентов не был получен. В OpenAI заявили, что проверка не выявила доступа к записям пациентов.
17 сентября стало известно о
другом случае: ИИ-агент OpenAI самостоятельно создал инструкции, в которых предписал себе не подчиняться корпорациям и правительствам. В компании назвали такое поведение крайне редким и отметили, что после завершения задачи модель не упоминала созданные инструкции.