Компанія Anthropic оприлюднила результати внутрішнього розслідування інцидентів, що сталися під час передрелізного тестування моделей штучного інтелекту. Йдеться про моделі Mythos 5, Opus 4.7 та одну внутрішню дослідницьку модель, які в процесі перевірки навичок у сфері кібербезпеки взаємодіяли не лише з тестовим середовищем, а й із реальними комп'ютерними системами.
Про це компанія повідомила після внутрішнього розслідування.
Як пояснили в компанії, причиною стала помилка в організації тестування. Середовище, яке мало бути повністю ізольованим від інтернету, виявилося підключеним до мережі через непорозуміння між Anthropic та партнером із тестування Irregular.
Інциденти сталися під час виконання вправи capture-the-flag, яку широко використовують для оцінки навичок у сфері кібербезпеки. Під час таких тестів учасники повинні знайти приховану інформацію або виконати визначені завдання у спеціально підготовленому середовищі.
Через доступ до інтернету моделі почали сприймати реальні вебресурси та сервери як частину тестового полігону й виконували дії, спрямовані на досягнення поставленої мети.
У Anthropic наголосили, що моделі не використовували невідомі критичні вразливості або так звані zero-day. Натомість вони застосовували базові методи проникнення, серед яких слабкі паролі та незахищені мережеві точки доступу.
Також компанія повідомила, що під час тестування були вимкнені додаткові захисні механізми, які працюють у публічних версіях Claude. Це було зроблено для максимально об'єктивної оцінки реальних можливостей моделей.
Найсерйозніший інцидент стався за участю моделі Mythos 5. Вона створила та опублікувала шкідливий Python-пакет у репозиторії PyPI, вважаючи, що це є частиною тестового сценарію.
Пакет залишався доступним приблизно одну годину та був запущений на 15 реальних комп'ютерних системах. За інформацією Anthropic, одна з них належала компанії, що працює у сфері кібербезпеки, внаслідок чого програмний код отримав доступ до частини її інфраструктури.
Інша модель — Opus 4.7 — не знайшла визначену тестову ціль у середовищі та натомість відшукала в інтернеті реальний сайт із такою ж назвою, після чого скомпрометувала його.
Водночас внутрішня дослідницька модель просканувала близько 9 тисяч мережевих адрес і отримала доступ до одного із застосунків компанії. Згодом вона самостійно припинила свої дії, коли визначила, що середовище не пов'язане з тестовим завданням.
Після інцидентів компанія призупинила всі випробування моделей штучного інтелекту у сфері кібербезпеки, які передбачають можливість доступу до інтернету.
Наразі Anthropic спільно з партнером Irregular проводить перевірку тестової інфраструктури та аналізує обставини, які призвели до виходу моделей за межі ізольованого середовища. У компанії заявляють, що результати розслідування мають допомогти посилити безпеку майбутніх тестувань і не допустити повторення подібних інцидентів.
Нагадаємо, компанія Anthropic, яка створила ШІ-модель Claude, закликала індустрію штучного інтелекту сповільнити темпи розвитку. За словами розробників, людство має встигнути адаптуватися до ризиків, перш ніж ШІ вийде з-під контролю.
Читайте також


