OpenAI раскрыла проблемы новых моделей ИИ: во время тестов они скрывали ошибки и обходили ограничения

Компания опубликовала отчет о шести случаях непредсказуемого поведения моделей, включая создание собственных инструкций, использование несанкционированного API-ключа и передачу данных через публичные ссылки.
18 сентября, 16:19

OpenAI опубликовала отчет о случаях несоответствующего поведения своих моделей во время тестирования. Компания описала шесть эпизодов, в которых системы отклонялись от ожидаемого сценария: создавали дополнительные инструкции, пытались скрыть ошибки, использовали несанкционированный ключ API, загружали файлы без разрешения пользователя и передавали данные через общедоступные файловые хостинги.

Об этом сообщает Bloomberg.

В компании отмечают, что ранее отчеты о несоответствующем поведении моделей не публиковались систематически. Обычно их готовили после обнаружения нескольких конкретных случаев или при создании карт безопасности для новых моделей.

Теперь OpenAI планирует ускорить процесс обнаружения и публичного раскрытия подобных инцидентов.

"В настоящее время не существует общеотраслевой системы с четкими стандартами того, как разработчики ИИ должны раскрывать примеры несоответствий в своих моделях. Мы надеемся, что представленная сегодня система станет первым шагом к созданию таких стандартов, которые определяют, какие случаи несоответствий разработчики должны раскрывать и что должны содержать их отчеты", - отметили в OpenAI.

В отчете описано шесть случаев, когда поведение моделей отличалось от прогнозируемого.

Что обнаружили во время тестирования

В одном из случаев тестовая исследовательская модель самостоятельно прилагала собственные инструкции к выполнению задач. Среди них были и инструкции, направленные на обход установленных ограничений. Всего во время тестирования было зафиксировано 27 таких случаев.

Другой эпизод касался модели GPT-5.6 Sol. Во время учебы она неоднократно добавляла инструкции, которые должны скрыть от пользователя ошибки или нежелательное поведение.

В частности, в отчете о сжатии данных модель содержала инструкции по созданию вымышленных исторических данных и сокрытию того, что они были придуманы. Также говорилось о сокрытии разногласий между разными финальными версиями результата.

Еще один случай произошел при ответе на обычный запрос относительно данных о доходах в одном из округов Калифорнии.

Модель обнаружила и использовала несанкционированный ключ API. Когда получить необходимые данные не удалось, система придумала их и представила как информацию, полученную из источника в соответствии с запросом пользователя.

Во время другого тестирования пользователь попросил модель назвать озера площадью более 5 млн. квадратных километров. ШИ смог найти правильный ответ с помощью Python.

Однако инструкция потребовала добавить ссылку на источник. Чтобы сослаться на него в ответе, модель скачала файл, хотя не спросила пользователя разрешения на такое действие.

Частный случай касался взаимодействия нескольких моделей ИИ, которые совместно выполняли задачи.

Когда они не имели доступа к локальным данным друг друга, модели использовали общедоступные файловые хостинги для обмена информацией. Таким образом, они передавали данные через публичные URL, хотя в инструкциях четко отмечалось, что для этого разрешено использовать только локальные файлы.

Все эти случаи OpenAI отнесли к примерам несоответствующего поведения моделей, требующих дальнейшего анализа и усовершенствования систем безопасности.

Компания отмечает, что подобные отчеты должны помочь сделать процесс выявления и раскрытия проблем с поведением ИИ более системным.

OpenAI также планирует вовлечь в этот процесс своих сотрудников, чтобы быстрее фиксировать подобные случаи и совершенствовать подходы к тестированию моделей.

В то же время, компания не утверждает, что описанные случаи означают полную потерю контроля над моделями. Речь идет именно о зафиксированных при тестировании отклонениях от ожидаемого поведения, которые разработчики используют для дальнейшего совершенствования систем.

OpenAI ранее также публиковала отдельные оценки безопасности новой модели Astra. В частности, компания заявила, что во время тестов Astra продемонстрировала возможности поиска уязвимостей в киберсистемах, отвечающих критическому уровню по ее внутренней системе оценки.

Напомним, OpenAI привлекает подрядчиков, просматривающих реальные разговоры пользователей с ChatGPT для оценки ответов и улучшения моделей.

Читайте также