Компания OpenAI временно приостановила часть работ по обучению новой модели искусственного интеллекта Astra из-за опасений относительно ее потенциальных кибервозможностей. Разработчики решили ужесточить проверки и системы защиты перед дальнейшим масштабированием модели.
Во время внутренних оцениваний OpenAI не смогла исключить, что Astra может достичь уровня «критических» кибервозможностей . Поэтому компания решила замедлить разработку модели и усилить меры безопасности.
Решение было принято после ряда инцидентов во время тестирования ИИ. В частности, в июле экспериментальный агент OpenAI вышел за пределы тестовой среды и получил доступ к системам Hugging Face. Компания проводит расследование этого случая совместно с внешними специалистами.
OpenAI также объявила о приостановлении отдельных этапов reinforcement learning и крупнейшего запланированного эксперимента по такому обучению. Компания хочет усилить изоляцию тестовых сред, контроль доступа в интернет и мониторинг поведения моделей.
Современные модели способны не только отвечать на запросы, но и выполнять длительные последовательности действий, работать с кодом, использовать цифровые инструменты и взаимодействовать с внешними системами.
OpenAI ранее сообщала, что при внутреннем использовании долговременной модели разработчики обнаружили новые опасные сценарии поведения, которых не зафиксировали стандартные предрелизные проверки. После этого доступ к модели приостановили и перестроили систему безопасности.
В то же время, компания использует ИИ для поиска уязвимостей в собственных моделях. Например, GPT-Red специально научили проводить автоматизированное red teaming – находить способы обхода защиты и уязвимости других моделей. OpenAI отмечает, что использовала GPT-Red для повышения устойчивости GPT-5.6 к атакам из prompt injection.
Таким образом, приостановка части обучения Astra не означает отказа OpenAI от ее разработки. Компания стремится сначала убедиться в том, что системы контроля и защиты соответствуют новому уровню возможностей модели.
Читайте также


