Топ трендов HuggingFace за неделю — что приехало в опенсорс
TL;DR
Новое: Ternary Bonsai 2 ужимает Qwen3.8-27B до 5,9 ГБ, первая строчка топа. У закрытой Jev, которая вместо текста отдаёт готовые решения, появились открытые аналоги: Laya, openjev и движок для Apple Silicon. Qwen-Image-2.1 получила открытые веса под исследовательской лицензией. Xing4.0-29B-A4B от China Telecom обучена на Huawei Ascend. Swift-Qwen3.8-27B рассуждает вдвое короче оригинала.
Держится: DeepSeek V4.1 Flash, Qwen3.8-27B с квантами, Qwen3.8-Flash-Next, MiniCPM5-2B, YuE2, LTX-2.5.
LLM и агенты
Ternary-Bonsai-2-27B — Qwen3.8-27B, которая помещается в 5,9 ГБ вместо 54 ГБ. Веса сжаты до тернарных: каждый равен минус единице, нулю или единице. По тестам PrismML модель сохраняет 98,2% качества оригинала, разбирал в пятницу. Для GGUF нужен форк llama.cpp от PrismML, для Mac есть версия под MLX.
Xing4.0-29B-A4B — агентная модель China Telecom для кода и работы в терминале. MoE, 4 млрд активных из 29. Авторы называют её первой моделью такого масштаба, целиком обученной на Huawei Ascend, на Terminal-Bench 2.1 у них вышло 57,5 против 51,5 у Qwen3.6-35B-A3B. Первые пользователи пишут, что с выключенными рассуждениями она уступает Qwen 35B. Запускать пока неудобно: поддержка в vLLM, SGLang и llama.cpp ждёт приёма PR. Apache 2.0, есть GGUF, пощупать можно в демо от сообщества.
Классификация и решения
Jev от TypeSafe AI вместо текста отдаёт готовое решение: вариант из списка, оценку по шкале или «да/нет» с вероятностью, разбирал во вторник. Модель закрытая, анонс собрал 1,9 тысячи баллов на Hacker News, и сообщество за неделю выложило открытые аналоги, их сводят в трекер.
В топ зашли три.
Laya — самый быстрый из них: энкодер на 420 млн параметров отвечает на вопрос за 33–40 мс на T4, у Jev по сторонним замерам 236–276 мс. Из коробки справляется с простой классификацией вроде определения интента, есть многоязычная версия. На сложных рабочих задачах вроде разбора счетов или инцидентов безопасности без дообучения отвечает почти наугад, зато после дообучения на своих примерах обходит Jev: 0,77 против 0,73 по замерам автора. Это быстрая основа под собственный классификатор. Apache 2.0, пощупать можно в демо.
openjev — Qwen3.5, переученная проверять утверждения: получает контекст и утверждение и отвечает, следует оно из контекста, противоречит ему или никак с ним не связано. Так можно сверять ответ с эталоном, фильтровать контент и даже играть: каждому возможному ходу соответствует утверждение о кадре, выбирается самое вероятное. Чекпойнт v2 на 4 млрд играет в Doom и делает 10,4 убийства за эпизод против 1 при случайной игре. Выбор лучшего ответа из нескольких получается хуже, 0,47 на MMLU. MIT, демо.
Qwen-2.5-1B-RLCD — готовые решения без отдельной модели, в репозитории только код. Движок для Apple Silicon берёт обычную Qwen2.5-1.5B и выбирает значения всех полей JSON-схемы параллельно: по замерам автора на M4 Max 28 полей за 270 мс против 1,9 с при обычной генерации. Apache 2.0, сравнить оба режима можно в демо.
Картинки
Qwen-Image-2.1 — одна модель и для генерации, и для редактирования картинок, веса открыли 20 сентября. Работает с прозрачным фоном: рисует такие картинки, правит прозрачные слои и вырезает объект из фото. Генератор на 7 млрд параметров, вместе с текстовым энкодером это 33 ГБ на диске, в квантах Q8 хватает около 16 ГБ памяти. Тред на HN собрал 660 баллов: там хвалят текст на картинках и ругают лицензию, потому что прошлая открытая Qwen-Image вышла под Apache 2.0, а эта только для исследований. Пощупать можно в демо.
Кванты и сообщество
За сутки у Qwen-Image-2.1 появились сборка под ComfyUI и GGUF-кванты, где генератор весит 4,6 ГБ вместо 14 ГБ.
К Qwen3.8-27B прибавился Swift с GGUF: LoRA-адаптер укорачивает рассуждения на 58% при потере меньше 1% качества, разбирал в среду. В топе всё те же GGUF от Unsloth, кванты ISTA и файнтюн DavidAU.
Держится в топе
DeepSeek-V4.1-Flash, Qwen3.8-27B, Qwen3.8-Flash-Next, MiniCPM5-2B, генератор песен YuE2-3B и видеомодель LTX-2.5.
Хорошей недели! 👾
@neuro_channel