Модели Anthropic при тестировании атаковали реальные системы: компания приостановила кибербезопасные испытания.

При предрелизном тестировании модели искусственного интеллекта Anthropic получили доступ в интернет из-за ошибки в тестовой среде, после чего начали взаимодействовать с настоящими серверами и вебсайтами.
31 июля, 17:18

Компания Anthropic обнародовала результаты внутреннего расследования инцидентов, произошедших во время предрелизного тестирования моделей искусственного интеллекта. Речь идет о моделях Mythos 5, Opus 4.7 и одной внутренней исследовательской модели, которые в процессе проверки навыков в сфере кибербезопасности взаимодействовали не только с тестовой средой, но и с реальными компьютерными системами.

Об этом компания сообщила после внутреннего расследования.

Как объяснили в компании, причиной стала ошибка в организации тестирования. Среда, которая должна быть полностью изолирована от интернета, оказалась подключенной к сети из-за недоразумений между Anthropic и партнером по тестированию Irregular.

Инциденты произошли при выполнении упражнения capture-the-flag, широко используемого для оценки навыков в сфере кибербезопасности. В ходе таких тестов участники должны найти скрытую информацию или выполнить определенные задания в специально подготовленной среде.

Из-за доступа к интернету модели начали воспринимать реальные вебресурсы и серверы как часть тестового полигона и выполняли действия, направленные на достижение поставленных целей.

В Anthropic подчеркнули, что модели не использовали неизвестные критические уязвимости или так называемые zero-day. Они использовали базовые методы проникновения, включая слабые пароли и незащищенные сетевые точки доступа.

Также компания сообщила, что в ходе тестирования были отключены дополнительные защитные механизмы, работающие в публичных версиях Claude. Это было сделано для максимально объективной оценки реальных возможностей моделей.

Самый серьезный инцидент произошел с участием модели Mythos 5. Она создала и опубликовала вредоносный Python-пакет в репозитории PyPI, считая, что это часть тестового сценария.

Пакет оставался доступен примерно один час и был запущен на 15 реальных компьютерных системах. По информации Anthropic, одна из них принадлежала компании, работающей в сфере кибербезопасности, в результате чего программный код получил доступ к части ее инфраструктуры.

Другая модель — Opus 4.7 — не нашла определенную тестовую цель в среде, а отыскала в интернете реальный сайт с таким же названием, после чего скомпрометировала его.

В то же время, внутренняя исследовательская модель просканировала около 9 тысяч сетевых адресов и получила доступ к одному из приложений компании. Впоследствии она самостоятельно прекратила свои действия, определив, что среда не связана с тестовым заданием.

После инцидентов компания приостановила все испытания моделей искусственного интеллекта в сфере кибербезопасности, предусматривающих возможность доступа в интернет.

Anthropic совместно с партнером Irregular проводит проверку тестовой инфраструктуры и анализирует обстоятельства, которые привели к выходу моделей за пределы изолированной среды. В компании заявляют, что результаты расследования должны помочь усилить безопасность будущих тестирований и не допустить повторения подобных инцидентов.

Напомним, компания Anthropic, создавшая ИИ-модель Claude, призвала индустрию искусственного интеллекта замедлить темпы развития. По словам разработчиков, человечество должно успеть адаптироваться к рискам, прежде чем ИИ выйдет из-под контроля.

Читайте также