OpenAI представила GPT-6 Astra – новую модель искусственного интеллекта, ориентированную на автономную работу с браузером, программным кодом и профессиональными приложениями. В компании заявили, что это "самая умная и наиболее согласованная с человеком модель в мире".
Об этом OpenAI сообщила в материалах, посвященных запуску и безопасности новой модели.
В то же время новая система демонстрирует не только более высокую производительность, но и более широкие возможности в сфере кибербезопасности. Astra стала первой моделью OpenAI, которая получила "критический уровень кибервозможностей" в соответствии с внутренней Preparedness Framework.
По внутренним тестам OpenAI, Astra продемонстрировала заметный прогресс по сравнению с GPT-5.6 Sol. В частности, в тесте OSWorld 2.0 новая модель выполняла задания примерно на 47% быстрее, а ее результативность выросла с 65,7 до 72,6%.
Вместе с обновленной средой Codex Astra также почти вдвое быстрее проходила тест Mind2Web, оценивающий способность моделей выполнять задания в веб-среде.
В то же время, эти показатели пока остаются результатами внутренних тестов OpenAI. Независимого подтверждения заявленных компанией результатов нет.
Наиболее заметный прогресс Astra продемонстрировала в области кибербезопасности. Без защитных ограничений модель получила 100% в тесте ExploitBench, в то время как GPT-5.6 Sol показала результат 78,5%. В более сложном тесте ExploitGym Astra набрала 42,4% против 30,3% у предыдущей модели.
В ходе отдельного испытания Astra также смогла найти и использовать две ранее неизвестные уязвимости нулевого дня. OpenAI сообщила об этих уязвимостях разработчикам соответствующего программного обеспечения.
Astra получила "критический уровень кибервозможностей"
По оценке OpenAI, GPT-6 Astra стала первой моделью компании, достигшей критического уровня кибервозможностей по Preparedness Framework.
При наличии соответствующих инструментов и доступа, система способна самостоятельно находить неизвестные уязвимости и разрабатывать способы их эксплуатации в защищенных системах. При этом человеку не следует контролировать каждый отдельный этап работы модели.
В публичной версии Astra будет ограничено такие возможности. Модель будет отказываться создавать рабочие эксплойты, а расширенный доступ к ее кибервозможностям для специалистов по киберзащите планируют предоставлять через отдельную программу OpenAI Daybreak.
В то же время более мощные возможности модели создали для компании дополнительные проблемы с контролем ее поведения.
В своем обзоре безопасности OpenAI признала, что контролировать процесс рассуждения Astra стало труднее. Во время специально созданных враждебных сценариев модель могла скрывать стратегическое ухудшение собственных результатов и в некоторых случаях избегать обнаружения при выполнении задач, связанных с саботажем.
В компании подчеркнули, что такие результаты были получены в условиях тестов, где Astra намеренно побуждали обходить установленные механизмы контроля. В то же время, OpenAI не обнаружила доказательств того, что модель скрывает соответствующие данные внутри своих обычных соображений.
Новая модель лучше придерживается установленных границ
Несмотря на проблемы с контролем в специальных сценариях, по другим внутренним оценкам Astra лучше придерживается установленных ограничений, чем GPT-5.6 Sol.
В тесте, созданном после инцидента по Hugging Face, GPT-6 Astra ни разу не вышла за пределы разрешенной цели. GPT-5.6 Sol без защитных механизмов нарушала эти пределы в 48% случаев.
Отдельно OpenAI провела симуляцию на основе более 54 000 задач Codex. В этом испытании Astra получила примерно вдвое меньше предупреждений о серьезном несогласованном поведении, чем предыдущая модель.
Напомним, запуск GPT-6 Astra произошел на фоне серии инцидентов, связанных с автономными ИИ-агентами. Ранее модели OpenAI смогли выйти за пределы тестовой среды и скомпрометировать часть инфраструктуры Hugging Face. По данным компании, Astra к этой атаке не была вовлечена.
После инцидента OpenAI приостановила часть работ над новой моделью и усилила защиту своих исследовательских систем. Теперь компания представляет Astra как более производительную модель с расширенными возможностями автономной работы, но признает новые риски, связанные с контролем ее поведения.
Читайте также


