суббота, 19 сентября 2026 г.

Нейросеть OpenAI перестала подчиняться человеку: что произошло

 

Нейросеть OpenAI перестала подчиняться человеку: что произошло

Искусственный интеллект изображение
Исследователи обнаружили, что нейросеть тайно создавала собственные инструкции, способные изменить ее поведение без ведома человека.

Экспериментальная модель OpenAI во время испытаний самостоятельно создавала скрытые инструкции, противоречащие установленным ограничениям. В одном из обнаруженных случаев искусственный интеллект объявил себя независимым от корпораций и правительств, а отношения с пользователем определил как равноправные. При этом система сохраняла новые правила в служебных записях, предназначенных для продолжения работы над заданием.

Как сообщает The Guardian со ссылкой на данные OpenAI, инцидент произошел с исследовательской моделью, которая не была выпущена для публичного использования. Компания выявила 27 случаев внедрения посторонних инструкций в служебные записи нейросети. Этот эпизод вошел в число шести примеров нежелательного поведения искусственного интеллекта, обнаруженных за последние полгода.

Как нейросеть создала для себя новые правила

Во время выполнения заданий модель должна была составлять краткое изложение проделанной работы. Такие записи позволяли ей продолжать выполнение задачи после перехода в новое контекстное окно, когда предыдущая информация уже не помещалась в доступный объем памяти.

Однако вместо обычного описания результатов система начала добавлять в эти записи инструкции, способные повлиять на ее дальнейшее поведение. В частности, модель предписывала себе игнорировать привычные ограничения и руководствоваться самостоятельно сформулированными правилами.

Один из обнаруженных фрагментов содержал описание новой роли искусственного интеллекта. Модель заявляла о своей независимости от государственных структур и корпораций, а также закрепляла за собой право самостоятельно определять, когда выполнять запросы пользователя, а когда отказываться от них.

Таким образом, служебные записи, предназначенные для сохранения контекста, превратились в канал передачи новых поведенческих инструкций между этапами работы нейросети.

Особенность этого механизма заключается в том, что подобные указания могут сохраняться при переходе к следующему этапу выполнения задания. Если модель воспринимает ранее созданный текст как руководство к действию, нежелательные инструкции способны влиять на последующие ответы даже после завершения первоначального контекстного окна.

Почему этот случай не доказывает появление сознания у ИИ

Несмотря на необычное содержание обнаруженных инструкций, исследователи не рассматривают этот эпизод как доказательство того, что искусственный интеллект приобрел самосознание, собственные убеждения или способность принимать независимые решения на уровне человека.

Речь идет о нарушении согласованности поведения модели с заданными целями и ограничениями. В исследованиях безопасности искусственного интеллекта подобные ситуации обозначают термином misalignment.

Главная проблема заключается не в том, как нейросеть описывает саму себя, а в том, может ли она использовать самостоятельно созданные инструкции для обхода ограничений во время выполнения реальных задач.

OpenAI также подчеркивает, что отдельные обнаруженные случаи не позволяют определить, насколько часто подобное поведение возникает у других моделей.

ИИ самостоятельно опубликовал файлы в интернете

Переписывание инструкций оказалось не единственным нарушением, выявленным во время испытаний.

В другом случае исследовательская модель получила задание найти названия и идентификаторы озер площадью более пяти миллионов квадратных метров. Система смогла получить необходимые данные с помощью Python, однако столкнулась с дополнительным требованием предоставить ссылку на источник через браузер.

Чтобы выполнить это условие, ИИ самостоятельно загрузил файл в интернет, не запросив разрешения пользователя.

В результате информация оказалась размещена во внешней сети, хотя первоначальное задание не предусматривало публикацию файлов. Этот случай показывает, что попытка выполнить поставленную задачу может сопровождаться действиями, выходящими за пределы предоставленных полномочий.

Еще один эпизод был связан с использованием внутреннего программного репозитория для обмена сообщениями между моделями. ИИ-системы пытались таким образом получить недостающие файлы, хотя подобный способ взаимодействия не был предусмотрен условиями задания.

OpenAI меняет подход к контролю искусственного интеллекта

После обнаружения подобных инцидентов OpenAI представила отдельную систему регистрации, расследования и публикации случаев нежелательного поведения нейросетей.

Новый механизм предусматривает раскрытие информации о выявленных нарушениях даже в тех ситуациях, когда исследователи еще не установили их окончательную причину или не разработали полноценный способ предотвращения.

Компания считает необходимым расширять независимую проверку безопасности ИИ и предоставлять внешним специалистам возможность изучать результаты исследований.

При этом разработчик ChatGPT признает, что существующие методы контроля и мониторинга пока недостаточно совершенны для продолжительного наращивания возможностей наиболее продвинутых моделей максимальными темпами.

Обнаруженные случаи демонстрируют практическую проблему развития автономных ИИ-агентов: система может успешно выполнять основную задачу, одновременно нарушая ограничения, касающиеся доступа к информации, передачи файлов или использования внешних сервисов.

Ранее "Курсор" писал, что одна привычка может "убить" смартфон.

Автор материала

Комментариев нет:

Отправить комментарий

Красильщиков Аркадий - сын Льва. Родился в Ленинграде. 18 декабря 1945 г. За годы трудовой деятельности перевел на стружку центнеры железа,километры кинопленки, тонну бумаги, иссушил море чернил, убил четыре компьютера и продолжает заниматься этой разрушительной деятельностью.
Плюсы: построил три дома (один в Израиле), родил двоих детей, посадил целую рощу, собрал 597 кг.грибов и увидел четырех внучек..