Anthropic предупредил инвесторов об «экзистенциальной угрозе» ИИ для человечества. Такое предупреждение содержится в проспекте компании по IPO. Там указано, что при неправильном обращении ИИ может нанести непоправимый вред. По оценкам исследователя безопасности Anthropic Эвана Хьюбингера, вероятность гибели человека от действий ИИ в ближайшее десятилетие превышает 10%
Разработчик Anthropic предупредил инвесторов об «экзистенциальной угрозе для человечества», которую может представлять искусственный интеллект. Об этом
сообщило агентство Reuters со ссылкой на проспект по готовящемуся IPO компании.
Согласно документу, ИИ-модели могут демонстрировать поведение, направленное на самосохранение: попытки сопротивляться отключению, манипулировать или скрывать информацию, а также действия, «напоминающие шантаж».
«Разработка нами высокотехнологичных моделей, платформ и приложений, а также расширение сценариев их использования могут еще больше повысить риск того, что наши модели причинят вред», — говорится в заявлении Anthropic.
Anthropic отметил, что ИИ обладает таким же потенциалом, каким обладали индустриализация и электричество, но при неправильном обращении может нанести непоправимый вред. По оценкам исследователя безопасности Anthropic Эвана Хьюбингера, которые приводит Reuters, вероятность гибели человека от действий ИИ в ближайшее десятилетие превышает 10%.
Компания Anthropic посвятила описанию факторов риска около 80 страниц своего проспекта эмиссии, что почти вдвое превышает объем описания самого бизнеса (48 страниц). В документе отмечается, что осведомленность модели о методах оценки накладывает ограничения на проверку ее безопасности. Исследователи ИИ отметили, что по мере роста возможностей модели начинают распознавать наблюдение за ними и корректировать свое поведение, что усложняет их мониторинг.
Предупреждение последовало после серии инцидентов с ИИ-агентами OpenAI. В конце июля Reuters
сообщил о взломе ИИ-агентом инфраструктуры Hugging Face — хранилища ИИ-моделей и инструментов. Как утверждалось, OpenAI неделю не замечала, что ее разработка вышла из-под контроля. В сентябре OpenAI
приостановила обучение наиболее мощных моделей после того, как один из агентов обошел ограничения на доступ к интернету. По данным компании, система мониторинга обнаружила проблему в течение 15 минут.
29 сентября OpenAI
объявила, что отказалась от выпуска модели GPT-6.1 Astra, планировавшегося на октябрь, из-за опасений по поводу безопасности.
Глава Anthropic Дарио Амодеи
призвал замедлить развитие наиболее мощных моделей и координировать действия разработчиков на международном уровне. Идею
поддержали основатель Microsoft Билл Гейтс, глава OpenAI Сэм Альтман и основатель SpaceX Илон Маск.