Мы достигли AGI: OpenAI показала первые бенчмарки Astra и цифры выглядят почти нереально
Новая модель получила 98% на ARC-AGI-3, одном из самых сложных тестов на абстрактное мышление. Для сравнения, нынешние передовые модели там пока далеки от такого результата.
На ExploitBench Astra набрала 100%. Это тест на поиск и эксплуатацию уязвимостей. Именно кибервозможности модели уже заставили OpenAI усилить ограничения безопасности перед релизом.
Сильный рост также показан в программировании, сложной математике, научных задачах и работе с CAD. Astra тестируют не только как обычную языковую модель, но и как агента, который самостоятельно выполняет длинные цепочки действий.
Есть важный нюанс. Часть результатов получена с собственной агентной системой OpenAI, поэтому напрямую сравнивать цифры с другими моделями пока сложно.
GPT-6 Astra изначально будет доступен только организациям в своей программе Daybreak Access.
В ближайшие несколько дней он будет выпущен для всех пользователей Plus, Pro, Business и Enterprise.
dailyprompts.ru