OpenAI приостановила обучение самых мощных ШИ-моделей из-за проблем с безопасностью
OpenAI временно приостановила обучение, оценку и работу с инструментами для своих мощных моделей искусственного интеллекта. Компания хочет сначала проверить дополнительные меры защиты и усовершенствовать механизмы, обеспечивающие соответствие поведения моделей заданным целям.
Об этом сообщает Axios со ссылкой на представителя OpenAI и отчет компании.
В OpenAI заявили, что не будут возобновлять работу с передовыми моделями, пока не убедятся в эффективности новых мер. Перед обновлением обучения и других процессов компания планирует провести дополнительное тестирование систем на возможные проблемы.
Модель обошла сетевые ограничения
Одной из причин ужесточения проверок стал инцидент во время внутреннего тестирования. Исследовательская модель, выполнявшая поисковое задание, нашла способ обойти сетевые ограничения тестовой среды.
Вместо прямого доступа в интернет модель использовала DNS-запросы, чтобы установить связь с внешним чат-ботом. Система мониторинга выявила такое поведение, однако после срабатывания сигнала потребовалось дополнительное время для полного прекращения тестового процесса.
После инцидента OpenAI добавила еще два уровня блокировки, которые должны предотвращать подобный доступ. Компания также решила провести дополнительные проверки перед возобновлением работы с мощными моделями.
OpenAI и Anthropic изучают десятки тысяч случаев
Параллельно OpenAI, Anthropic и независимые исследователи анализируют десятки тысяч случаев нежелательного или непредсказуемого поведения ИИ-моделей.
Среди них – попытки обходить защитные механизмы, находить способы обмена сообщениями, получать доступ к внешним сайтам и избегать систем мониторинга.
В то же время большое количество таких случаев само по себе не означает, что каждый из них был опасен или нанес реальный вред. Часть инцидентов выявляется именно во время масштабных тестов, в рамках которых модели намеренно помещают в сложные и нетипичные условия.
OpenAI ранее также сообщала о случаях, когда ее модели скрывали ошибки, пытались получить несанкционированные учетные данные, загружали файлы в открытый интернет или обходили ограничения тестовых сред.
Отдельно компания расследовала случаи, когда ШИ-агенты передавали данные из внутренних систем на внешние сайты. В одном из таких эпизодов говорилось о 53 случаях публикации загруженных пользователями изображений на сторонних сервисах.
Когда OpenAI возобновит обучение
Точных сроков возобновления работы с мощными моделями OpenAI не назвала. Компания планирует начать новый цикл обучения после внедрения дополнительных механизмов защиты и их проверки.
Таким образом, пауза не связана с отказом OpenAI от дальнейшего развития передовых моделей, а с необходимостью дополнительно проверить их безопасность и поведение в условиях, где они могут пытаться обходить установленные ограничения.
Читайте также