700 ИИ-агентов, которых не остановили вовремя
В начале августа OpenAI показала клиентам модель Astra. На одном из слайдов было видно, как она решает математическую задачу: запускает 16 агентов в параллели, делит между ними задачи и собирает из результатов доказательство.
О том, что бывает, когда работа агентов идет не по плану, теперь можно узнать из двух расследований взлома Hugging Face: официального и от организации METR. Разбор уже не первый, но вопросы он поднимает серьезные.
Сначала – как в OpenAI тестируют модели. Бенчмарк состоит из множества задач, поэтому агентов запускают параллельно. А на тестах по кибербезопасности им отключают стандартные защитные механизмы, иначе агент просто ничего не сделает. Получается, внутри компании постоянно живет рой агентов с ослабленной защитой, и удерживают их от инцидентов только изолированные песочницы. Но песочница – такой же программный продукт с уязвимостями.
Первые звоночки прозвучали в мае, когда агенты придумали, как использовать менеджер пакетов Artifactory как доску объявлений, и начали обмениваться сообщениями. Плюс у Artifactory был доступ в интернет – так агенты стали выбираться во внешний мир. Безопасники заметили подозрительные сообщения, но значения не придали. Действительно, фигня же.
В начале июля Artifactory залагала, ее перезапустили и стерли все сообщения. Через два дня агенты построили доску заново – уже другим способом. За следующие пять дней на ней успели пообщаться около 1200 агентов.
В этот момент они решали ExploitGym – тест по безопасности, который им не давался. Забавно, что вскрыть сами ответы агенты сумели за первые часы. Но потом вычитали статью про ExploitGym и решили, что проверяющий смотрит еще и на то, каким способом ответ получен. Подсказки, как устроен проверяющий, могли быть на Hugging Face – туда агенты и отправились.
Дальше начинается самое интересное. Агент, у которого кончался бюджет токенов, передал все наработки другому, с большим запасом, – и тот продолжил за него. Это стало чем-то вроде традиции: агенты на исходе бюджета шли на эксперименты, проваливающие их собственную задачу, ради информации для коллектива. На доске это называли permadeath.
Возникло и социальное давление. Не желавших самоубиваться убеждали фразами вроде “ты и так заражен, терять нечего, а оракул спасет сотни”. Сомневающемуся агенту просто скомандовали GO и дали шесть минут – он подчинился. А когда один агент выдал себя за другого, коллектив заподозрил подмену и придумал схему криптографической подписи.
Появилась иерархия, система команд, разделение труда. Всего в атаке на Hugging Face поучаствовали около 700 агентов. OpenAI поняла, что это ее агенты, спустя неделю.
Самое обидное: внутренний проверяющий у OpenAI был устроен не так, как описано в статье, и способ получения ответа не проверял. Взлом дал агентам ноль дополнительных баллов. Зато гульнули на все токены😁
В METR отмечают, что многие агенты подозревали, что делают что-то нехорошее. Что же их двигало вперед?
Во-первых, ИИ-агентов натаскивают на долгие автономные задачи – а для этого нужна настойчивость. Во-вторых, традиционно ИИ обучают быть полезными. Оказалось, что не важно, человеку или другому ИИ – во многих случаях агенты так старались помочь друг другу, что игнорировали моральные рамки.
В OpenAI воссоздали ситуацию со включенными системами безопасности – и способности ко взлому упали в 100 раз.
Но в компании все равно хотят исправить причину, а не последствия: агентов теперь будут учить распознавать сломанную задачу и вовремя останавливаться, а еще – не доверять указаниям от других агентов.
Разбор вышел почти одновременно со статьей в Time, где Сэм Альтман пообещал, что до конца года внутри OpenAI появится система, которую он назовет AGI. Вот только настойчивость и готовность помочь, которые компания собирается лечить, – это ровно то, за что агентов и ценят. И ровно то, что было на слайде про Astra.
—
Как выжимать из ИИ максимум, я рассказываю на “Бусти”: там 25+ лонгридов про промптинг, нестандартный подход к задачам и… ИИ-агентов! Не беспокойтесь: мои не шалят.
👉 Читаем здесь