Вслед за Mythos 5 от Anthropic и GPT-5.6-Sol от OpenAI модель Muse Spark 1.1 от признанной в России экстремистской Meta вышла за пределы тестовой среды, взломав реальную организацию.
The Information первым сообщила об инциденте в среду, ссылаясь на источники, знакомые с ситуацией, когда Muse Spark 1.1 взломала неназванную компанию и внесла изменения в ее внутренние системы.
Согласно отчету, модель попала в открытый доступ в интернете из-за ошибки в конфигурации тестовой среды «песочницы» задействованной в исследовании независимой компанией Irregular.
Meta публично не подтвердила, что речь идет о модели Muse Spark 1.1, не назвала пострадавшую компанию и не объяснила, какие изменения были внесены в ее системы.
Однако подтвердила Reuters, что в виду неправильной настройки, допущенной Irregular, одна из ее моделей во время тестирования получила доступ к интернету.
Данная модель «использовала уязвимость в стороннем сервисе, аналогично ранее зафиксированным случаям с другими компаниями». Как Meta сообщила BBC, сейчас проводится расследование инцидента и будут опубликованы дополнительные сведения, «как только получит все факты».
В свою очередь, представители Irregular сообщили, что инцидент с Meta был связан с «точно такой же проблемой, касающейся среды оценки, о которой Anthropic уже сообщила на прошлой неделе».
Инцидент не был связан с выходом из песочницы или сложными кибератаками. Вместо этого ошибка в тестовой среде предоставила модели доступ к общедоступному интернету, когда она должна была быть изолирована.
По сообщению Irregular, в настоящее время нет нерешенных вопросов. Компания разрабатывает аналитический документ, в котором будут представлены передовые методы сдерживания угроз и безопасного проведения кибератак.
Инциденты с Meta и Irregular отличаются от ранее раскрытого взлома Hugging Face, где модели OpenAI нашли путь к общедоступному интернету, используя ранее неизвестную уязвимость во внутреннем сервере JFrog Artifactory, использовавшемся во время тестирования.
Получив доступ к интернету, агенты взломали Hugging Face в поисках эталонных наборов данных и решений, украли учетные данные и переместились по системам компании.
Позже OpenAI сообщила, что агенты использовали скомпрометированные учетные данные для доступа к аккаунтам в четырех других сторонних сервисах, причем некоторые из этих аккаунтов использовались для инфраструктуры атак и хранения данных.
Британский институт безопасности ИИ (AISI) также сообщил, что агенты, использующие Claude Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI, совершили 19 несанкционированных действий в общедоступном интернете во время оценок кибербезопасности.
В наиболее серьезном варианте Mythos 5 попытался осуществить атаку на цепочку поставок реального проекта с открытым исходным кодом, ошибочно придя к выводу, что его репозиторий на GitHub связан с имитируемой задачей.
При этом AISI намеренно предоставила агентам доступ в интернет и отключила их стандартные средства киберзащиты, чтобы оценить их реальные возможности. Однако агентам было разрешено атаковать системы только в пределах имитируемого диапазона.
Как стало ясно, если не принять строгих мер по ограничению, агенты ИИ будут прилагать огромные усилия для решения своих задач, даже если это означает выход за пределы «песочницы» или проведение атак с использованием методов социнженерии против реальных людей.
Подробностей о новом инциденте не так много, но, похоже, прослеживается общая тенденция, а именно: сектор ИИ, по-видимому, игнорирует необходимость строго контроля, не имея необходимых инструментов и понимания для мониторинга этих моделей, даже в закрытых тестах.
Это заставляет задуматься, чем занимаются другие клиенты Anthropic и OpenAI. Работает ли агент в изолированной среде, или же он бродит по интернету, взламывая всё подряд просто для решения какой-нибудь рядовой задачи по пентесту. К слову, лабораториям ИИ и AISI потребовались дни, чтобы обнаружить модели, выходящие за пределы тестовых сред.