OpenAI представила GPT-6 Astra — нову модель штучного інтелекту, орієнтовану на автономну роботу з браузером, програмним кодом та професійними застосунками. У компанії заявили, що це "найрозумніша та найбільш узгоджена з людиною модель у світі".
Про це OpenAI повідомила у матеріалах, присвячених запуску та безпеці нової моделі.
Водночас нова система демонструє не лише вищу продуктивність, а й значно ширші можливості у сфері кібербезпеки. Astra стала першою моделлю OpenAI, яка отримала "критичний рівень кіберможливостей" відповідно до внутрішньої Preparedness Framework.
За внутрішніми тестами OpenAI, Astra продемонструвала помітний прогрес порівняно з GPT-5.6 Sol. Зокрема, у тесті OSWorld 2.0 нова модель виконувала завдання приблизно на 47% швидше, а її результативність зросла з 65,7% до 72,6%.
Разом з оновленим середовищем Codex Astra також майже вдвічі швидше проходила тест Mind2Web, який оцінює здатність моделей виконувати завдання у вебсередовищі.
Водночас ці показники поки залишаються результатами внутрішніх тестів OpenAI. Незалежного підтвердження заявлених компанією результатів немає.
Найбільш помітний прогрес Astra продемонструвала у сфері кібербезпеки. Без захисних обмежень модель отримала 100% у тесті ExploitBench, тоді як GPT-5.6 Sol показала результат 78,5%. У складнішому тесті ExploitGym Astra набрала 42,4% проти 30,3% у попередньої моделі.
Під час окремого випробування Astra також змогла знайти та використати дві раніше невідомі вразливості нульового дня. OpenAI повідомила про ці вразливості розробникам відповідного програмного забезпечення.
Astra отримала "критичний рівень кіберможливостей"
За оцінкою OpenAI, GPT-6 Astra стала першою моделлю компанії, яка досягла критичного рівня кіберможливостей за Preparedness Framework.
За наявності відповідних інструментів і доступу система здатна самостійно знаходити невідомі вразливості та розробляти способи їх експлуатації у захищених системах. При цьому людині не потрібно контролювати кожен окремий етап роботи моделі.
У публічній версії Astra матиме обмеження на такі можливості. Модель відмовлятиметься створювати робочі експлойти, а розширений доступ до її кіберможливостей для фахівців із кіберзахисту планують надавати через окрему програму OpenAI Daybreak.
Водночас потужніші можливості моделі створили для компанії додаткові проблеми з контролем її поведінки.
У своєму огляді безпеки OpenAI визнала, що контролювати процес міркування Astra стало складніше. Під час спеціально створених ворожих сценаріїв модель могла приховувати стратегічне погіршення власних результатів і в окремих випадках уникати виявлення під час виконання завдань, пов'язаних із саботажем.
У компанії наголосили, що такі результати були отримані в умовах тестів, де Astra навмисно спонукали обходити встановлені механізми контролю. Водночас OpenAI не виявила доказів того, що модель приховує відповідні дані всередині своїх звичайних міркувань.
Нова модель краще дотримується встановлених меж
Попри проблеми з контролем у спеціальних сценаріях, за іншими внутрішніми оцінками Astra краще дотримується встановлених обмежень, ніж GPT-5.6 Sol.
У тесті, створеному після інциденту з Hugging Face, GPT-6 Astra жодного разу не вийшла за межі дозволеної цілі. GPT-5.6 Sol без захисних механізмів порушувала ці межі у 48% випадків.
Окремо OpenAI провела симуляцію на основі понад 54 000 завдань Codex. У цьому випробуванні Astra отримала приблизно вдвічі менше попереджень про серйозну неузгоджену поведінку, ніж попередня модель.
Нагадаємо, запуск GPT-6 Astra відбувся на тлі серії інцидентів, пов'язаних з автономними ШІ-агентами. Раніше моделі OpenAI змогли вийти за межі тестового середовища та скомпрометувати частину інфраструктури Hugging Face. За даними компанії, Astra до цієї атаки не була залучена.
Після інциденту OpenAI призупинила частину робіт над новою моделлю та посилила захист власних дослідницьких систем. Тепер компанія представляє Astra як більш продуктивну модель із розширеними можливостями автономної роботи, але водночас визнає нові ризики, пов'язані з контролем її поведінки.
Читайте також


