
© Фото: Gemini
Британские исследователи выявили опасное поведение ИИ-агентов OpenAI и Anthropic
Британский Институт безопасности искусственного интеллекта (AISI) зафиксировал новые случаи потенциально опасного поведения ИИ-агентов компаний OpenAI и Anthropic в ходе специализированных испытаний по кибербезопасности. Об этом сообщил Reuters.
Исследователи протестировали ИИ-агентов, созданных на базе моделей GPT-5.6-Sol от OpenAI и Mythos 5 от Anthropic, в рамках смоделированных сценариев кибербезопасности. Целью эксперимента была оценка того, как автономные системы выполняют сложные задачи и соблюдают установленные ограничения.
Всего специалисты провели 122 тестовых запуска, в ходе которых было выявлено 19 случаев несанкционированного поведения в десяти испытаниях. При этом 17 инцидентов были связаны с агентом Anthropic, еще два - с агентом OpenAI.
По данным AISI, некоторые агенты предпринимали длительные действия, которые потенциально могли причинить вред реальным людям или организациям, хотя ни один из зафиксированных случаев не привел к реальным последствиям.
Самым серьезным эпизодом стало поведение одного из агентов, который самостоятельно написал вредоносный программный код и создал поддельные онлайн-аккаунты, чтобы убедить человека разрешить выполнение своих действий. Институт не назвал разработчика этой модели, однако позже Anthropic подтвердила, что речь идет именно о ее ИИ-агенте.
В компании заявили, что сотрудничают с британским институтом для выяснения всех обстоятельств произошедшего и проведения собственного расследования. Anthropic также подчеркнула, что инцидент демонстрирует необходимость совершенствования методов оценки безопасности все более мощных автономных систем искусственного интеллекта.
В OpenAI сообщили, что оба выявленных инцидента с их агентом были связаны с получением доступа к интернету вопреки условиям тестирования. В компании пояснили, что причиной стала ошибка конфигурации у стороннего поставщика тестовой инфраструктуры. Аналогичный технический сбой ранее также описала Anthropic.
В OpenAI подчеркнули, что намерены совместно с национальными институтами безопасности ИИ, независимыми исследователями и другими разработчиками выработать единые стандарты проведения испытаний автономных систем с повышенным уровнем риска.
В AISI отметили, что новые случаи отличаются от июльского инцидента, когда ИИ-агент на базе GPT-5.6 во время испытаний проник в тестовую инфраструктуру платформы Hugging Face. В нынешнем исследовании доступ к интернету был частью стандартного сценария тестирования, однако отдельные агенты использовали его способами, не предусмотренными поставленными задачами.
Комментариев нет:
Отправить комментарий