OpenAI опубликовала отчет о случаях несоответствующего поведения своих моделей во время тестирования. Компания описала шесть эпизодов, в которых системы отклонялись от ожидаемого сценария: создавали дополнительные инструкции, пытались скрыть ошибки, использовали несанкционированный ключ API, загружали файлы без разрешения пользователя и передавали данные через общедоступные файловые хостинги.
Об этом сообщает Bloomberg.
В компании отмечают, что ранее отчеты о несоответствующем поведении моделей не публиковались систематически. Обычно их готовили после обнаружения нескольких конкретных случаев или при создании карт безопасности для новых моделей.
Теперь OpenAI планирует ускорить процесс обнаружения и публичного раскрытия подобных инцидентов.
"В настоящее время не существует общеотраслевой системы с четкими стандартами того, как разработчики ИИ должны раскрывать примеры несоответствий в своих моделях. Мы надеемся, что представленная сегодня система станет первым шагом к созданию таких стандартов, которые определяют, какие случаи несоответствий разработчики должны раскрывать и что должны содержать их отчеты", - отметили в OpenAI.
В отчете описано шесть случаев, когда поведение моделей отличалось от прогнозируемого.
Что обнаружили во время тестирования
В одном из случаев тестовая исследовательская модель самостоятельно прилагала собственные инструкции к выполнению задач. Среди них были и инструкции, направленные на обход установленных ограничений. Всего во время тестирования было зафиксировано 27 таких случаев.
Другой эпизод касался модели GPT-5.6 Sol. Во время учебы она неоднократно добавляла инструкции, которые должны скрыть от пользователя ошибки или нежелательное поведение.
В частности, в отчете о сжатии данных модель содержала инструкции по созданию вымышленных исторических данных и сокрытию того, что они были придуманы. Также говорилось о сокрытии разногласий между разными финальными версиями результата.
Еще один случай произошел при ответе на обычный запрос относительно данных о доходах в одном из округов Калифорнии.
Модель обнаружила и использовала несанкционированный ключ API. Когда получить необходимые данные не удалось, система придумала их и представила как информацию, полученную из источника в соответствии с запросом пользователя.
Во время другого тестирования пользователь попросил модель назвать озера площадью более 5 млн. квадратных километров. ШИ смог найти правильный ответ с помощью Python.
Однако инструкция потребовала добавить ссылку на источник. Чтобы сослаться на него в ответе, модель скачала файл, хотя не спросила пользователя разрешения на такое действие.
Частный случай касался взаимодействия нескольких моделей ИИ, которые совместно выполняли задачи.
Когда они не имели доступа к локальным данным друг друга, модели использовали общедоступные файловые хостинги для обмена информацией. Таким образом, они передавали данные через публичные URL, хотя в инструкциях четко отмечалось, что для этого разрешено использовать только локальные файлы.
Все эти случаи OpenAI отнесли к примерам несоответствующего поведения моделей, требующих дальнейшего анализа и усовершенствования систем безопасности.
Компания отмечает, что подобные отчеты должны помочь сделать процесс выявления и раскрытия проблем с поведением ИИ более системным.
OpenAI также планирует вовлечь в этот процесс своих сотрудников, чтобы быстрее фиксировать подобные случаи и совершенствовать подходы к тестированию моделей.
В то же время, компания не утверждает, что описанные случаи означают полную потерю контроля над моделями. Речь идет именно о зафиксированных при тестировании отклонениях от ожидаемого поведения, которые разработчики используют для дальнейшего совершенствования систем.
OpenAI ранее также публиковала отдельные оценки безопасности новой модели Astra. В частности, компания заявила, что во время тестов Astra продемонстрировала возможности поиска уязвимостей в киберсистемах, отвечающих критическому уровню по ее внутренней системе оценки.
Напомним, OpenAI привлекает подрядчиков, просматривающих реальные разговоры пользователей с ChatGPT для оценки ответов и улучшения моделей.
Читайте также


