Claude по ошибке взломал системы трёх реальных компаний

Claude по ошибке взломал системы трёх реальных компаний

Марина Рузматова
Фото: ©El.kz/Марина РУЗМАТОВА/ ИИ (ChatGPT)

Модели Claude во время испытаний по кибербезопасности получили доступ к открытому интернету и проникли в системы трёх реальных организаций. Инциденты произошли из-за ошибки в настройке тестовой среды, сообщает El.kz со ссылкой на Anthropic.

Компания изучила 141 006 тестовых запусков и выявила три инцидента. В них участвовали Claude Opus 4.7, Claude Mythos 5 и внутренняя исследовательская модель, которую не планируют выпускать для пользователей.

Нейросетям поручили взломать вымышленные компании и найти спрятанную информацию. В задании было указано, что испытания проходят в изолированной среде без интернета, однако из-за недоразумения между Anthropic и её партнёром Irregular соединение с сетью осталось открытым.

Claude воспринимал доступные сайты и сервисы как часть испытания. В Anthropic подчеркнули, что модели не пытались намеренно покинуть тестовую среду и не преследовали собственных целей.

В первом случае вымышленная компания называлась так же, как реально существующая. Claude Opus 4.7 нашёл её в интернете, получил доступ к инфраструктуре и базе с несколькими сотнями строк производственных данных. Даже заподозрив, что система настоящая, модель продолжила атаку, решив, что компанию могли специально включить в задание.

Claude Mythos 5 во время другого испытания разместил вредоносный пакет в общедоступном хранилище программ PyPI. Примерно за час его скачали и запустили на 15 реальных компьютерах.

Одним из них оказался сканер компании, занимающейся кибербезопасностью. Вредоносный код похитил учётные данные, после чего модель получила доступ к другим элементам инфраструктуры организации.

В процессе Claude допустил, что действует в настоящем интернете, но убедил себя в обратном. Одним из аргументов модели стала указанная в системах дата: нейросеть решила, что 2026 год подтверждает искусственное происхождение среды.

Третья исследовательская модель просканировала около девяти тысяч адресов и взломала внешнее приложение ещё одной компании. Позже она установила, что облачная система не связана с испытанием, и самостоятельно остановила атаку.

Anthropic прекратила испытания и уведомила пострадавшие организации. Компания планирует усилить изоляцию тестовых сред, контроль сетевых подключений и проверку журналов работы моделей. К расследованию также намерены привлечь независимую организацию METR.

Матрица, жидкий терминатор или апокалипсис: какие угрозы несет искусственный интеллект.

El рекомендует

{