🎙 CrisperWhisper 2.0 ● распознавание речи дословно, с точностью до слова ● EN ● by Nyra Labs
Ссылка на GitHub: nyrahealth/CrisperWhisper Автор: Nyra Labs (nyra health) Дата обновления: 27 июля 2026 Версия: 2.0.1 (PyPI) Категории: #ASR #речьвтекст #субтитры #Whisper Платформа: Windows / Linux / macOS, ставится через pip Язык интерфейса: EN (Python API) Совместимость: NVIDIA CUDA через CTranslate2, либо PyTorch — включая голый CPU Системные требования: четыре размера — turbo / small / medium / large, квантование float16 и int8_float16
🖥 Описание софта Все системы распознавания речи молча решают за вас один вопрос: записывать то, что человек сказал, или то, что он имел в виду. Решают неосознанно — как получилось в обучающих данных, и каждый раз по-разному. CrisperWhisper 2.0 впервые делает этот выбор явным переключателем. Одна запись — две расшифровки: дословная, со всеми «э-э», запинками, оборванными словами и смехом, — и чистая, где числа, даты и почта уже приведены к человеческому виду. Плюс лучшие в индустрии пословные тайминги: 29,6 мс средней ошибки границы слова против 64,8 мс у WhisperX.
😬 Что умеет CrisperWhisper 2.0 🟠 Два режима одной командой: verbatim — каждый филлер, повтор, заикание и фальстарт; intended — чистый читаемый текст 🟠 Пословные тайминги 29,6 мс на читаной речи и 41 мс на разговорной — первое место, обгоняет Grok, ElevenLabs Scribe v2, Deepgram и WhisperX 🟠 Детекция запинок 87,8 F1 в среднем по десяти языкам. Для сравнения: ElevenLabs Scribe v2 — 79,2, Deepgram Nova-3 — 37,8, AssemblyAI Universal-3 Pro — 30,5, прошлая версия CrisperWhisper — 64,8 🟠 Verbatimize — уникальная штука: даёте аудио и уже готовую чистую расшифровку, модель вставляет в неё ровно те запинки, что реально звучат. Узнаваемость редких слов взлетает с 6,8% до 96,1% против повторной расшифровки с нуля 🟠 Длинное аудио без швов: каждое окно продолжает уже расшифрованные слова, поэтому на стыках не пропадают и не задваиваются куски 🟠 Подавление галлюцинаций встроено в декодер и включено по умолчанию — та самая беда Whisper, когда он зацикливается и сочиняет текст на тишине 🟠 Спекулятивное декодирование: маленькая модель предлагает токены, большая проверяет — тот же результат в 1,3–1,4 раза быстрее 🟠 Оба режима за один проход, принудительное выравнивание готового текста по аудио, буст на нужные имена и термины 🟠 Мультиязычность на уровне обычного Whisper — оба режима работают на большинстве поддерживаемых им языков
💿 Установка и запуск ⁍ NVIDIA + Linux, самый быстрый путь: pip install "crisperwhisper[ct2]" ⁍ Windows, macOS или просто CPU: pip install "crisperwhisper[transformers]" from crisperwhisper import CrisperWhisperModel model = CrisperWhisperModel() result = model.transcribe("meeting.wav", language="en", word_timestamps=True) ⁍ Веса скачиваются с HuggingFace при первом запуске
⭐️ Поставить звезду на GitHub - звёзд уже больше тысячи
🌐 Онлайн демо - для тестирования в браузере
🤗 Модели на HuggingFace - четыре открытые и одна Pro по заявкам
💬 Обсудить в нашем чате
👾 РЕПАКИ И ПОРТАТИВКИ ПОЛЕЗНЫХ НЕЙРОСЕТЕЙ ● НЕЙРОСОФТ