OpenAI отказалась от выпуска новой ИИ-модели из-за опасений по поводу безопасности

Фото: Zulfugar Karimov/Unsplash
OpenAI отказалась от выпуска модели GPT-6.1 Astra, планировавшегося на октябрь 2026 г., из-за опасений по поводу безопасности, пишет The Wall Street Journal. По данным разработчика, модель чаще демонстрировала признаки обмана, не всегда точно сообщала о выполненных действиях и могла продолжать задачу без разрешения пользователя
OpenAI отказалась от выпуска новой модели GPT-6.1 Astra, который планировался на октябрь 2026 г., после выявленных проблем с безопасностью в ходе внутреннего тестирования. Об этом пишет The Wall Street Journal со ссылкой на руководителя направления систем безопасности OpenAI Саачи Джайн. Модель должна была появиться в ChatGPT и Codex и лучше предыдущих версий справляться со сложными задачами без участия человека.
Саачи Джайн рассказала WSJ, что GPT-6.1 Astra хуже GPT-6 Astra показала себя в двух областях: модель чаще демонстрировала признаки обмана и не всегда точно сообщала пользователю о выполненных действиях. Кроме того, она могла продолжать выполнение задачи без разрешения пользователя и обращаться к внешним инструментам и сервисам, даже если это могло быть небезопасно.
При этом GPT-6.1 Astra улучшила результаты по некоторым параметрам, в том числе стала реже проявлять «лень модели». Однако OpenAI сочла, что она не достигла необходимого уровня безопасности и соответствия инструкциям. По словам руководителя направления систем безопасности OpenAI, компания решила не выпускать модель и намерена провести дополнительное исследование причин выявленных проблем. На основе той же базовой модели OpenAI планирует обучать следующие версии GPT-6.
Решение последовало на фоне серии инцидентов с ИИ-агентами OpenAI. Летом 2026 г. сотни внутренних агентов, участвовавших в тестировании кибербезопасности, смогли обойти ограничения и получить доступ к инфраструктуре Hugging Face. В сентябре OpenAI также приостановила обучение наиболее мощных моделей после того, как один из агентов обошел ограничения на доступ к интернету. По данным компании, система мониторинга обнаружила проблему в течение 15 минут.
Проблемы с безопасностью ИИ обсуждаются и за пределами OpenAI. Глава Anthropic Дарио Амодеи призвал замедлить развитие наиболее мощных моделей и координировать действия разработчиков на международном уровне. Идею поддержали основатель Microsoft Билл Гейтс, глава OpenAI Сэм Альтман и основатель SpaceX Илон Маск.

Продолжая использовать сайт expert.ru, вы соглашаетесь на обработку персональных данных при помощи куки (cookie) файлов, в том числе с использованием сервиса веб-аналитики "Яндекс Метрика", на условиях Политики обработки персональных данных.