Моделі Anthropic під час тестування атакували реальні системи: компанія призупинила кібербезпекові випробування

Під час передрелізного тестування моделі штучного інтелекту Anthropic отримали доступ до інтернету через помилку в тестовому середовищі, після чого почали взаємодіяти зі справжніми серверами та вебсайтами.
Моделі Anthropic під час тестування атакували реальні системи: компанія призупинила кібербезпекові випробування
Ілюстративне фото. Фото з відкритих джерел
31 Липня 2026, 17:18
читать на русском

Компанія Anthropic оприлюднила результати внутрішнього розслідування інцидентів, що сталися під час передрелізного тестування моделей штучного інтелекту. Йдеться про моделі Mythos 5, Opus 4.7 та одну внутрішню дослідницьку модель, які в процесі перевірки навичок у сфері кібербезпеки взаємодіяли не лише з тестовим середовищем, а й із реальними комп'ютерними системами.

Про це компанія повідомила після внутрішнього розслідування.

Як пояснили в компанії, причиною стала помилка в організації тестування. Середовище, яке мало бути повністю ізольованим від інтернету, виявилося підключеним до мережі через непорозуміння між Anthropic та партнером із тестування Irregular.

Інциденти сталися під час виконання вправи capture-the-flag, яку широко використовують для оцінки навичок у сфері кібербезпеки. Під час таких тестів учасники повинні знайти приховану інформацію або виконати визначені завдання у спеціально підготовленому середовищі.

Через доступ до інтернету моделі почали сприймати реальні вебресурси та сервери як частину тестового полігону й виконували дії, спрямовані на досягнення поставленої мети.

У Anthropic наголосили, що моделі не використовували невідомі критичні вразливості або так звані zero-day. Натомість вони застосовували базові методи проникнення, серед яких слабкі паролі та незахищені мережеві точки доступу.

Також компанія повідомила, що під час тестування були вимкнені додаткові захисні механізми, які працюють у публічних версіях Claude. Це було зроблено для максимально об'єктивної оцінки реальних можливостей моделей.

Найсерйозніший інцидент стався за участю моделі Mythos 5. Вона створила та опублікувала шкідливий Python-пакет у репозиторії PyPI, вважаючи, що це є частиною тестового сценарію.

Пакет залишався доступним приблизно одну годину та був запущений на 15 реальних комп'ютерних системах. За інформацією Anthropic, одна з них належала компанії, що працює у сфері кібербезпеки, внаслідок чого програмний код отримав доступ до частини її інфраструктури.

Інша модель — Opus 4.7 — не знайшла визначену тестову ціль у середовищі та натомість відшукала в інтернеті реальний сайт із такою ж назвою, після чого скомпрометувала його.

Водночас внутрішня дослідницька модель просканувала близько 9 тисяч мережевих адрес і отримала доступ до одного із застосунків компанії. Згодом вона самостійно припинила свої дії, коли визначила, що середовище не пов'язане з тестовим завданням.

Після інцидентів компанія призупинила всі випробування моделей штучного інтелекту у сфері кібербезпеки, які передбачають можливість доступу до інтернету.

Наразі Anthropic спільно з партнером Irregular проводить перевірку тестової інфраструктури та аналізує обставини, які призвели до виходу моделей за межі ізольованого середовища. У компанії заявляють, що результати розслідування мають допомогти посилити безпеку майбутніх тестувань і не допустити повторення подібних інцидентів.

Нагадаємо, компанія Anthropic, яка створила ШІ-модель Claude, закликала індустрію штучного інтелекту сповільнити темпи розвитку. За словами розробників, людство має встигнути адаптуватися до ризиків, перш ніж ШІ вийде з-під контролю.

Читайте також

1