#дайджест
Дайджест AI/ML за неделю 27 июля - 2 августа 2026
ByteDance: Seedance 2.5
Теперь генерирует 4K-видео до 30 секунд за один проход. Можно принести до 50 референсов: 30 изображений, 10 видео, 10 аудио, сценарии, раскадровки и описания персонажей. Для точного переноса движения принимает видео на хромакее или анимацию белой 3D-болванки, а отдельные области результата можно переделывать без перегенерации всего ролика.
В Dreamina также тестируют extended mode на 5–180 секунд, но это уже надстройка для длинных видео с несколькими сценами. Модель доступна в Dreamina, дают бесплатные ежедневные кредиты.
Страница модели
MiniMax: H3
Новая мультимодальная генеративная модель принимает текст, изображения, видео и аудио, а выдает видео до 15 секунд в 2K с нативным стереозвуком. Модель генерирует и редактирует картинки, видео и аудио, делает перенос движения, работу с референсами и multi-shot. В общем, все ещё пытаются в кнопку "сделать красиво". Полные веса собираются открыть скоро, техрепорт тоже обещают потом.
Блогпост
Google DeepMind: Gemini Robotics ER 2
Модель смотрит непрерывный видеопоток, разбивает задачу на шаги, передает команды VLA-моделям и другим контроллерам, а затем проверяет, действительно ли робот все сделал. Может параллельно думать и действовать, вызывать Google Search и пользовательские функции, замечать ошибки и повторять неудачные шаги, также есть возможность работы нескольких роботов над одной задачей. Модель доступна через Gemini API и AI Studio.
Блогпост
DeepSeek: V4 Flash 0731
DeepSeek сделали посттренинг V4 Flash, не меняя архитектуру и размер модели. На собственных прогонах получили 82.7% на Terminal-Bench 2.1, 54.4% на DeepSWE и 70.3% на Toolathlon Verified. Цена - $0.14/$0.28 за миллион токенов и $0.0028 за закэшированный ввод.
Список изменений
Moonshot AI: Kimi K3
Moonshot сдержали обещание и выложили полные веса 2.8T-модели: 104B активных параметров, 896 экспертов, 16 активных и контекст 1М. Веса сразу квантованы в MXFP4, потому что даже так запускать трехтриллионную модель дома придется вместе с соседями.
Также вышел техрепорт с разбором Kimi Delta Attention, Attention Residuals и Stable LatentMoE.
Техрепорт, веса
Pacing the Frontier: открытое письмо от сотрудников фронтир лаб
1324 сотрудника OpenAI, Anthropic, Google, Meta и других лабораторий подписали обращение к правительству США. Они просят создать механизм замедления разработки фронтир моделей, если экспонента попрет в сингулярность. Компании находятся внутри трагедии общин, поэтому нужна внешняя регуляция. Подписали Илья Суцкевер, Дарио Амодеи, Джон Шульман и др.
Обращение
OpenAI: GPT Transcribe и GPT Live Transcribe
Две новые speech-to-text модели: GPT Transcribe расшифровывает файлы и завершенные реплики за $0.0045 в минуту, GPT Live Transcribe отдает текст кусками прямо во время разговора за $0.017 в минуту. Обеим можно передать контекст, нужные термины и список языков, а у Live настраивается компромисс между задержкой и точностью.
GPT Transcribe, GPT Live Transcribe
Google: Lyria 3.5
Апдейт музыкальной модели Google. По отзывам стало лучше, но все еще не Suno. Хотя из явных плюсов, если вас уже воротит от типичного звучания Suno, у этой модели оно немного другое. Пока доступна только в Google Flow Music, про API не рассказали.
Блогпост
Менее значительные релизы:
OpenAI: открытия в математике
Astra (следующая модель OpenAI размера Mythos) за $2к нашла решения и улучшения для десяти задач в разных сферах математики
Публикация
OpenAI: GPT-5.6 подешевели - Terra теперь стоит $2/$12, а Luna $0.20/$1.20 за миллион токенов. Sol осталась на $5/$30. Внутри компании Sol помогла переписать GPU-ядра и снизить стоимость инференса на 20%. Блогпост
Thinking Machines Lab: Inkling-Small - компания Миры Мурати выпустила маленькую версию своей модели. Опенсорс, 276B параметров и 12B активных, с контекстом 1М, нативные изображение и аудио. Блогпост, веса