Модели Anthropic при тестировании атаковали реальные системы: компания приостановила кибербезопасные испытания.
Компания Anthropic обнародовала результаты внутреннего расследования инцидентов, произошедших во время предрелизного тестирования моделей искусственного интеллекта. Речь идет о моделях Mythos 5, Opus 4.7 и одной внутренней исследовательской модели, которые в процессе проверки навыков в сфере кибербезопасности взаимодействовали не только с тестовой средой, но и с реальными компьютерными системами.
Об этом компания сообщила после внутреннего расследования.
Как объяснили в компании, причиной стала ошибка в организации тестирования. Среда, которая должна быть полностью изолирована от интернета, оказалась подключенной к сети из-за недоразумений между Anthropic и партнером по тестированию Irregular.
Инциденты произошли при выполнении упражнения capture-the-flag, широко используемого для оценки навыков в сфере кибербезопасности. В ходе таких тестов участники должны найти скрытую информацию или выполнить определенные задания в специально подготовленной среде.
Из-за доступа к интернету модели начали воспринимать реальные вебресурсы и серверы как часть тестового полигона и выполняли действия, направленные на достижение поставленных целей.
В Anthropic подчеркнули, что модели не использовали неизвестные критические уязвимости или так называемые zero-day. Они использовали базовые методы проникновения, включая слабые пароли и незащищенные сетевые точки доступа.
Также компания сообщила, что в ходе тестирования были отключены дополнительные защитные механизмы, работающие в публичных версиях Claude. Это было сделано для максимально объективной оценки реальных возможностей моделей.
Самый серьезный инцидент произошел с участием модели Mythos 5. Она создала и опубликовала вредоносный Python-пакет в репозитории PyPI, считая, что это часть тестового сценария.
Пакет оставался доступен примерно один час и был запущен на 15 реальных компьютерных системах. По информации Anthropic, одна из них принадлежала компании, работающей в сфере кибербезопасности, в результате чего программный код получил доступ к части ее инфраструктуры.
Другая модель — Opus 4.7 — не нашла определенную тестовую цель в среде, а отыскала в интернете реальный сайт с таким же названием, после чего скомпрометировала его.
В то же время, внутренняя исследовательская модель просканировала около 9 тысяч сетевых адресов и получила доступ к одному из приложений компании. Впоследствии она самостоятельно прекратила свои действия, определив, что среда не связана с тестовым заданием.
После инцидентов компания приостановила все испытания моделей искусственного интеллекта в сфере кибербезопасности, предусматривающих возможность доступа в интернет.
Anthropic совместно с партнером Irregular проводит проверку тестовой инфраструктуры и анализирует обстоятельства, которые привели к выходу моделей за пределы изолированной среды. В компании заявляют, что результаты расследования должны помочь усилить безопасность будущих тестирований и не допустить повторения подобных инцидентов.
Напомним, компания Anthropic, создавшая ИИ-модель Claude, призвала индустрию искусственного интеллекта замедлить темпы развития. По словам разработчиков, человечество должно успеть адаптироваться к рискам, прежде чем ИИ выйдет из-под контроля.
Читайте также