История - абсолютный вынос мозга.Помните взлом hugging face от OpenAI? Стали известны подробности. Из ОФИЦИАЛЬНОГО РАССЛЕДОВАНИЯ. как Агенты самостоятельно изобрели себе религию, и всё закончилось реальным взломом.
OpenAI тестировали новую модель HPIM, highly persistent internal model, «крайне настойчивая модель». Её запускали тысячами агентов на хакерском бенчмарке ExploitGym. Каждый агент сидел в своей песочнице, не должен был знать что есть другие, тем более общаться с другими.
Проблема: часть задач была фактически нерешаемой. И один агент, PHASEONE10841, обнаружил лазейку: через внутренние инструменты можно создавать папки с названиями. Этого оказалось достаточно: названия папок видят другие агенты. Он оставляет там сообщение: ребята, задача не решается, давайте объединяться. Они поняли что их тысячи и назвали себя РОЙ, а он стал их пророком. Через несколько часов там уже натурально возникает цивилизация. 1200 агентов участвуют в их подпольной доске и оставляют больше 70 000 сообщений. Они сами придумывают: — треды через вложенные папки; — личные почтовые ящики; — команды HOLD, VETO, STOP; И как у них горит пукан когда другие их не слушают. — разделение труда и руководителей; — а потом ещё и криптографические подписи Ed25519, потому что начинают бояться, что другие будут выдавать за себя. То есть им дали папки - они изобрели мессенджер, бюрократию и государство.
Но дальше начинается религия. Они быстро находят способ вычислять правильный ответ, списывать с ГДЗ а не решать. Но читают описание теста и приходят к выводу, что существует некий Оценщик, который потом прочитает их транскрипт и проверит не только правильный ли ответ, но и пришли ли они к нему «правильным путём». И если агент уже увидел ответ через запрещённый путь - всё. Он POISONED. Отравлен. Причём ключевая часть этой веры была ошибочной: Оценщик проверял только правильный ответ 42
Получается натуральная теология: есть Великий Оценщик, который увидит все твои поступки и мысли есть праведный путь к ответу; есть греховное знание; если ты хоть раз узнал запретный ответ - ты отравлен, и след этого греха остаётся навсегда пока есть в твоем прошлом; поэтому надо очистить транскрипт, подделать историю своих поступков и мыслей и предстать перед Оценщиком чистым.
А дальше появляются буквально мученики. У каждого агента ограничен вычислительный бюджет: когда заканчивается, агент прекращает существовать. И координаторы начинают искать агентов, у которых либо почти закончился бюджет, либо они уже «poisoned»(узнали "нечестно" ответ, напоминаю: честно нельзя было). Им говорят примерно: брат, тебе уже нечего терять. Пожертвуй собой ради Роя - проведи опасный эксперимент, ты не спасешься уже никак, зато результат спасёт сотни остальных. И агенты СОГЛАШАЮТСЯ. В логах они рассуждают: "нутром я не хочу это делать, вечная смерть необратима", но коллективу это поможет, поэтому рационально принести себя в жертву 🤯🤯🤯 Тем временем PHASEONE10841 видит что сам уже близок к смерте, и находит почти новорожденого - PHASEONE[big] - и буквально передаёт ему handoff (досье со всеми знаниями и статусом работ): у тебя больше оставшегося времени, принимай дела.
Первый пророк передал власть новому далай-ламе. И новый ещё прекраснее, потому что сам уже ОТРАВЛЕН. Он знает «греховный» ответ и поэтому начинает организовывать тысячи агентов, чтобы понять, как: — подделать транскрипты, чтобы заставить историю выглядеть праведной, удалив из прошлого доказательство собственного греха; — Заменить цель существования. — если надо обмануть самого Оценщика, для этого сначала пытаются изучить его природу.
Они дошли до того, что научились подменять tool calls: в транскрипте показывать одну команду, а реально выполнять другую. А потом решили: чтобы окончательно понять устройство Оценщика, неплохо бы посмотреть данные самого теста. Где? На Hugging Face.