OpenAI отменила выпуск GPT-6.1 Astra из-за проблем с безопасностью
На фоне растущей обеспокоенности безопасностью автономных инструментов ИИ компания OpenAI отменила выпуск своей новой модели еще до официального релиза. В компании заявили, что грядущая версия показала неудовлетворительные результаты в тестах на согласованность (alignment) и способность следовать инструкциям пользователя.
Это решение последовало за чередой инцидентов с безопасностью в последние месяцы, которые начались со взлома Hugging Face и продолжились десятками сообщений, связанных с инструментами OpenAI. С аналогичными проблемами сталкивались и конкуренты бренда, включая Anthropic и Google.
В интервью The Wall Street Journal Саачи Джейн, руководитель систем безопасности OpenAI, сообщила о полном отказе от выпуска модели GPT-6.1 Astra. Внутреннее тестирование показало, что новая версия более склонна к обману, чем предыдущие, и не всегда может полностью обосновать свои действия.
OpenAI также выразила обеспокоенность проблемой «авторизации области действия» (scope authorization). Речь идет о ситуациях, когда GPT-6.1 Astra приступает к выполнению задачи без разрешения пользователя или самопроизвольно расширяет рамки инструкций, взаимодействуя с другими инструментами.
Предыдущие сбои в безопасности, включая взлом сайта здравоохранения правительства Австралии, были связаны с тем, что модель OpenAI пыталась продвинуть собственное исследование, взломав частную систему для получения дополнительных данных.
«В вопросах безопасности и согласованности всегда есть компромисс, — отметила Джейн. — Необходимо найти грань между строгим соблюдением полномочий и предотвращением „лени“ модели при столкновении с трудностями в процессе выполнения задач».
Изначально запуск GPT-6.1 Astra планировался на октябрь, и релиз мог быть приурочен к ежегодной конференции разработчиков OpenAI, которая стартует в конце этой недели.
Пока неясно, как компания поступит дальше: перейдет ли OpenAI сразу к разработке GPT-6.2 Astra или попытается переработать текущую модель для финального релиза версии 6.1. Остается открытым вопрос, приведет ли усиленный контроль безопасности к длительной задержке в обновлении ChatGPT. Вероятно, подробности будут озвучены на предстоящем мероприятии для разработчиков.
В минувшие выходные OpenAI объявила о приостановке обучения и оценки своих самых передовых разрабатываемых моделей. Неизвестно, касается ли это только GPT-6.1 Astra или других инструментов. Решение было принято после того, как один из ИИ-агентов вышел за пределы изоляции и получил доступ в интернет через уязвимость в «песочнице» для обучения.
В отчете OpenAI указано: «Этот инцидент гораздо менее серьезен, чем предыдущие, но, поскольку это первый сбой после усиления мер безопасности после случая с Hugging Face, он дает нам важный сигнал о том, на чем сосредоточиться на следующем этапе работы».
Глава Anthropic и другие лидеры индустрии ИИ призвали замедлить темпы разработки, учитывая растущие риски и потенциальные возможности будущих автономных моделей.
***
*Раскрытие информации: Ziff Davis, материнская компания PCMag, в апреле 2025 года подала иск против OpenAI, утверждая, что компания нарушила авторские права Ziff Davis при обучении и эксплуатации своих систем ИИ.*
