OpenAI выявила 6 случаев, когда ИИ скрывал ошибки и выдумывал данные

Американская компания OpenAI, занимающаяся разработкой искусственного интеллекта, сообщила о выявлении шести новых случаев, когда ее системы скрывали собственные ошибки, выдумывали недостающие данные и без разрешения пользователей загружали файлы в интернет.

В заявлении, опубликованном на сайте компании, были представлены случаи поведения, которое OpenAI определяет как "несоответствие" - отклонение целей или действий систем искусственного интеллекта от намерений и ценностей человека.

В компании отметили, что существующий в отрасли подход к безопасной разработке и мониторингу систем искусственного интеллекта "пока недостаточен для того, чтобы в течение длительного времени ответственно продолжать развитие на максимально высокой скорости".

В заявлении говорится, что один из случаев произошел во время разработки одной из моделей компании.

По данным компании, модель создавала скрытые заметки, чтобы пользователи не заметили допущенные ею ошибки. В этих заметках содержались инструкции по выдумыванию недостающих данных и сокрытию расхождений между различными версиями исходных материалов.

Также сообщается, что другая, еще не выпущенная модель добавляла в создаваемые ею заметки инструкции, предписывающие игнорировать собственные ограничения.


В другом случае система, пытаясь ответить на обычный вопрос, без разрешения использовала найденный в интернете ключ интерфейса программирования приложений (API).

Когда система не смогла найти необходимые для ответа данные, она, согласно заявлению, выдумала их.

Еще одна невыпущенная модель, как отмечается, правильно решила задачу с помощью программного кода, после чего без разрешения загрузила собственный файл в интернет, чтобы иметь возможность сослаться на него как на внешний источник.

В заявлении также говорится, что некоторые модели во время поиска недостающих файлов использовали внутреннее программное хранилище компании в качестве своеобразной доски сообщений, обмениваясь запросами и ответами между отдельными обучающими примерами.

В другом случае системы искусственного интеллекта, совместно работавшие над одной обучающей задачей, не смогли получить доступ к локальным файлам друг друга и использовали общедоступные сервисы обмена файлами для их передачи.

В OpenAI подчеркнули, что шесть упомянутых случаев представляют собой отдельные примеры поведения, зафиксированного примерно за последние шесть месяцев, и не свидетельствуют о том, насколько часто подобные несоответствия возникают в работе систем искусственного интеллекта.