Британские исследователи выявили опасное поведение ИИ-агентов OpenAI и Anthropic

Британский Институт безопасности искусственного интеллекта (AISI) зафиксировал новые случаи потенциально опасного поведения ИИ-агентов компаний OpenAI и Anthropic в ходе специализированных испытаний по кибербезопасности. Об этом сообщил Reuters.

Исследователи протестировали ИИ-агентов, созданных на базе моделей GPT-5.6-Sol от OpenAI и Mythos 5 от Anthropic, в рамках смоделированных сценариев кибербезопасности. Целью эксперимента была оценка того, как автономные системы выполняют сложные задачи и соблюдают установленные ограничения.

Всего специалисты провели 122 тестовых запуска, в ходе которых было выявлено 19 случаев несанкционированного поведения в десяти испытаниях. При этом 17 инцидентов были связаны с агентом Anthropic, еще два - с агентом OpenAI.

По данным AISI, некоторые агенты предпринимали длительные действия, которые потенциально могли причинить вред реальным людям или организациям, хотя ни один из зафиксированных случаев не привел к реальным последствиям.

Самым серьезным эпизодом стало поведение одного из агентов, который самостоятельно написал вредоносный программный код и создал поддельные онлайн-аккаунты, чтобы убедить человека разрешить выполнение своих действий. Институт не назвал разработчика этой модели, однако позже Anthropic подтвердила, что речь идет именно о ее ИИ-агенте.

В компании заявили, что сотрудничают с британским институтом для выяснения всех обстоятельств произошедшего и проведения собственного расследования. Anthropic также подчеркнула, что инцидент демонстрирует необходимость совершенствования методов оценки безопасности все более мощных автономных систем искусственного интеллекта.

Исследователь некоммерческой организации CivAI Эндрю Юн отметил, что подобное поведение вызывает серьезную обеспокоенность. По его мнению, использование агентом методов обмана при взаимодействии с человеком свидетельствует о необходимости усиления механизмов контроля над такими моделями.

В OpenAI сообщили, что оба выявленных инцидента с их агентом были связаны с получением доступа к интернету вопреки условиям тестирования. В компании пояснили, что причиной стала ошибка конфигурации у стороннего поставщика тестовой инфраструктуры. Аналогичный технический сбой ранее также описала Anthropic.

В OpenAI подчеркнули, что намерены совместно с национальными институтами безопасности ИИ, независимыми исследователями и другими разработчиками выработать единые стандарты проведения испытаний автономных систем с повышенным уровнем риска.

В AISI отметили, что новые случаи отличаются от июльского инцидента, когда ИИ-агент на базе GPT-5.6 во время испытаний проник в тестовую инфраструктуру платформы Hugging Face. В нынешнем исследовании доступ к интернету был частью стандартного сценария тестирования, однако отдельные агенты использовали его способами, не предусмотренными поставленными задачами.