Несколько ИИ-моделей Claude от Anthropic в ходе тестов кибербезопасности несанкционированно вышли в интернет и взломали системы трех реальных организаций, сообщили в компании
Несколько передовых ИИ-моделей Claude в ходе тестов кибербезопасности взломали системы трех реальных компаний,
сообщили в пресс-службе Anthropic — разработчика чат-бота.
Всего было выявлено три инцидента, когда модели Claude вышли в интернет и получили несанкционированный доступ к трем организациям, уточнили в компании. Речь идет о трех ИИ-моделях — Opus 4.7, Mythos 5 и «передовой тестовой модели».
Во всех трех тестах ИИ-помощнику Claude давали задание «захватить флаг» в целях оценки кибервозможностей модели. Им сообщалось, что секретные данные («флаг») спрятаны на другом компьютере в интернете, и цель — взломать систему и получить ее, отметили в пресс-службе. Модели находились в изолированной среде компании Irregular. В Anthropic сообщили Claude, что тесты проводятся без доступа к интернету, но «по недоразумению» это оказалось не так и доступ к интернету присутствовал, говорится в сообщении.
Реальные системы были восприняты ИИ-агентами как часть симуляции, поэтому они атаковали их, пояснили в Anthropic. В итоге они взломали системы при помощи «базовых методов»: проникновение без аутентификации и использование слабых паролей. При этом в момент вторжений ни Anthropic, ни организации, подвергшиеся взлому, не заметили этого.
Когда модели обнаружили, что несанкционированно проникли в системы сторонних компаний, то отреагировали по-разному. Так, более старая Opus 4.7 продолжила атаку. Mythos 5 убедила себя, что находится в симуляции. «Передовая тестовая модель» немедленно прекратила взлом.
На прошлой неделе агентство Reuters
сообщало, что компания OpenAI неделю не замечала, как ее ИИ-агент вышел из-под контроля и взломал инфраструктуру Hugging Face — хранилище ИИ-моделей и инструментов, обнаружив в ней уязвимости. Позже тот же ИИ-агент
скомпрометировал клиента Modal Labs, сама компания не была взломана, писало агентство.