ИИ против ИИ: новые методы контроля и безопасности автоматизированных агентов

На фоне дискуссий об автоматизированном хакинге с помощью ИИ и растущих опасений по поводу проблемы согласования (alignment), ряд компаний предложили решения для самых острых проблем этих технологий. Как сообщает TechCrunch, основным методом борьбы стало внедрение дополнительного ИИ в процесс контроля.

Несколько стартапов разрабатывают защитные системы на базе ИИ для надзора за «непослушными» агентами. Компания Apollo Research представила Watcher AI — систему, которая отслеживает работу ИИ-кодинга, чтобы предотвратить вредоносные действия, утечку данных или удаление важных файлов без явного разрешения пользователя.

Watcher использует многоуровневый мониторинг. На первом этапе проводится быстрый общий обзор; при обнаружении подозрительного поведения запрос передается продвинутому монитору для детального анализа. Только после этого человек принимает окончательное решение об утверждении или отклонении действий агента.

Конкурирующая компания Goodfire предлагает иной подход: вместо анализа выходных данных она исследует внутренние активации нейросети, чтобы определить наличие вредоносных намерений.

После атаки на Hugging Face генеральный директор Goodfire в сети X подчеркнул, что компания делает ставку на интерпретацию работы ИИ через «резюме рассуждений» (reasoning summary). Это направлено на повышение безопасности в таких критических областях, как кибербезопасность и биоинженерия.

Стоит отметить, что методы анализа путей рассуждений ранее использовались в «атаках дистилляции», когда одну модель обучают на выходных данных другой. Чтобы противодействовать таким атакам, некоторые разработчики намеренно делают резюме рассуждений менее читаемыми, затрудняя извлечение их истинного смысла.

Однако не все уверены, что ИИ может быть лекарством от проблем, которые он сам создает. Существуют альтернативные, не основанные на ИИ методы — например, создание надежных журналов действий агентов, которые затем интерпретируются традиционными инструментами кибербезопасности. Несмотря на кажущуюся простоту ИИ-мониторинга, интеграция проверенных систем безопасности может оказаться более разумным решением, чем полагаться на непроверенную автоматизацию.

***

Джон Мартиндейл — технологический журналист из Великобритании с 20-летним опытом. Он писал для таких изданий, как ExtremeTech, Digital Trends, Forbes, U.S. News & World Report и Lifewire. В свободное время увлекается настольными играми и мангой.

Джон специализируется на обзорах компьютерных компонентов и создании прикладных руководств: от базовых инструкций по созданию скриншотов до настройки криптовалютных кошельков. Особый интерес для него представляет объективный анализ противостояния технологических гигантов в сфере CPU и GPU.

Игровой ПК Джона построен на базе процессора 7950X3D и видеокарты 7900XTX, что позволяет ему комфортно играть как в легкие инди-проекты, так и в требовательные симуляторы вроде Kerbal Space Program. В работе он использует наушники Jabra Active 8, беспроводную гарнитуру SteelSeries Arctis Pro и механическую клавиатуру Logitech G915.

Похожие записи

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

Этот сайт использует Akismet для борьбы со спамом. Узнайте, как обрабатываются ваши данные комментариев.