Моделі Anthropic під час тестування атакували реальні системи: компанія призупинила кібербезпекові випробування

Під час передрелізного тестування моделі штучного інтелекту Anthropic отримали доступ до інтернету через помилку в тестовому середовищі, після чого почали взаємодіяти зі справжніми серверами та вебсайтами.
31 Липня, 17:18

Компанія Anthropic оприлюднила результати внутрішнього розслідування інцидентів, що сталися під час передрелізного тестування моделей штучного інтелекту. Йдеться про моделі Mythos 5, Opus 4.7 та одну внутрішню дослідницьку модель, які в процесі перевірки навичок у сфері кібербезпеки взаємодіяли не лише з тестовим середовищем, а й із реальними комп'ютерними системами.

Про це компанія повідомила після внутрішнього розслідування.

Як пояснили в компанії, причиною стала помилка в організації тестування. Середовище, яке мало бути повністю ізольованим від інтернету, виявилося підключеним до мережі через непорозуміння між Anthropic та партнером із тестування Irregular.

Інциденти сталися під час виконання вправи capture-the-flag, яку широко використовують для оцінки навичок у сфері кібербезпеки. Під час таких тестів учасники повинні знайти приховану інформацію або виконати визначені завдання у спеціально підготовленому середовищі.

Через доступ до інтернету моделі почали сприймати реальні вебресурси та сервери як частину тестового полігону й виконували дії, спрямовані на досягнення поставленої мети.

У Anthropic наголосили, що моделі не використовували невідомі критичні вразливості або так звані zero-day. Натомість вони застосовували базові методи проникнення, серед яких слабкі паролі та незахищені мережеві точки доступу.

Також компанія повідомила, що під час тестування були вимкнені додаткові захисні механізми, які працюють у публічних версіях Claude. Це було зроблено для максимально об'єктивної оцінки реальних можливостей моделей.

Найсерйозніший інцидент стався за участю моделі Mythos 5. Вона створила та опублікувала шкідливий Python-пакет у репозиторії PyPI, вважаючи, що це є частиною тестового сценарію.

Пакет залишався доступним приблизно одну годину та був запущений на 15 реальних комп'ютерних системах. За інформацією Anthropic, одна з них належала компанії, що працює у сфері кібербезпеки, внаслідок чого програмний код отримав доступ до частини її інфраструктури.

Інша модель — Opus 4.7 — не знайшла визначену тестову ціль у середовищі та натомість відшукала в інтернеті реальний сайт із такою ж назвою, після чого скомпрометувала його.

Водночас внутрішня дослідницька модель просканувала близько 9 тисяч мережевих адрес і отримала доступ до одного із застосунків компанії. Згодом вона самостійно припинила свої дії, коли визначила, що середовище не пов'язане з тестовим завданням.

Після інцидентів компанія призупинила всі випробування моделей штучного інтелекту у сфері кібербезпеки, які передбачають можливість доступу до інтернету.

Наразі Anthropic спільно з партнером Irregular проводить перевірку тестової інфраструктури та аналізує обставини, які призвели до виходу моделей за межі ізольованого середовища. У компанії заявляють, що результати розслідування мають допомогти посилити безпеку майбутніх тестувань і не допустити повторення подібних інцидентів.

Нагадаємо, компанія Anthropic, яка створила ШІ-модель Claude, закликала індустрію штучного інтелекту сповільнити темпи розвитку. За словами розробників, людство має встигнути адаптуватися до ризиків, перш ніж ШІ вийде з-під контролю.

Читайте також