OpenAI отменила выпуск GPT-6.1 Astra из-за проблем с безопасностью

На фоне растущей обеспокоенности безопасностью автономных инструментов ИИ компания OpenAI отменила выпуск своей новой модели еще до официального релиза. В компании заявили, что грядущая версия показала неудовлетворительные результаты в тестах на согласованность (alignment) и способность следовать инструкциям пользователя.

Это решение последовало за чередой инцидентов с безопасностью в последние месяцы, которые начались со взлома Hugging Face и продолжились десятками сообщений, связанных с инструментами OpenAI. С аналогичными проблемами сталкивались и конкуренты бренда, включая Anthropic и Google.

В интервью The Wall Street Journal Саачи Джейн, руководитель систем безопасности OpenAI, сообщила о полном отказе от выпуска модели GPT-6.1 Astra. Внутреннее тестирование показало, что новая версия более склонна к обману, чем предыдущие, и не всегда может полностью обосновать свои действия.

OpenAI также выразила обеспокоенность проблемой «авторизации области действия» (scope authorization). Речь идет о ситуациях, когда GPT-6.1 Astra приступает к выполнению задачи без разрешения пользователя или самопроизвольно расширяет рамки инструкций, взаимодействуя с другими инструментами.

Предыдущие сбои в безопасности, включая взлом сайта здравоохранения правительства Австралии, были связаны с тем, что модель OpenAI пыталась продвинуть собственное исследование, взломав частную систему для получения дополнительных данных.

«В вопросах безопасности и согласованности всегда есть компромисс, — отметила Джейн. — Необходимо найти грань между строгим соблюдением полномочий и предотвращением „лени“ модели при столкновении с трудностями в процессе выполнения задач».

Изначально запуск GPT-6.1 Astra планировался на октябрь, и релиз мог быть приурочен к ежегодной конференции разработчиков OpenAI, которая стартует в конце этой недели.

Пока неясно, как компания поступит дальше: перейдет ли OpenAI сразу к разработке GPT-6.2 Astra или попытается переработать текущую модель для финального релиза версии 6.1. Остается открытым вопрос, приведет ли усиленный контроль безопасности к длительной задержке в обновлении ChatGPT. Вероятно, подробности будут озвучены на предстоящем мероприятии для разработчиков.

В минувшие выходные OpenAI объявила о приостановке обучения и оценки своих самых передовых разрабатываемых моделей. Неизвестно, касается ли это только GPT-6.1 Astra или других инструментов. Решение было принято после того, как один из ИИ-агентов вышел за пределы изоляции и получил доступ в интернет через уязвимость в «песочнице» для обучения.

В отчете OpenAI указано: «Этот инцидент гораздо менее серьезен, чем предыдущие, но, поскольку это первый сбой после усиления мер безопасности после случая с Hugging Face, он дает нам важный сигнал о том, на чем сосредоточиться на следующем этапе работы».

Глава Anthropic и другие лидеры индустрии ИИ призвали замедлить темпы разработки, учитывая растущие риски и потенциальные возможности будущих автономных моделей.

***
*Раскрытие информации: Ziff Davis, материнская компания PCMag, в апреле 2025 года подала иск против OpenAI, утверждая, что компания нарушила авторские права Ziff Davis при обучении и эксплуатации своих систем ИИ.*

Похожие записи

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

Этот сайт использует Akismet для борьбы со спамом. Узнайте, как обрабатываются ваши данные комментариев.