Точность распознавания речи — не абстрактная метрика. Полтора часа записи вручную перепечатываются около трёх часов: каждая ошибка распознавания оплачивается вашим временем. Из чего складывается точный результат.
Фактор первый: движок
Основа основ — модель распознавания. Связки на Whisper понимают больше 90 языков, включая китайский, и распознают речь на уровне, при котором текст правится точечно, а не переписывается. Но внутри одного семейства модели различаются: малые быстрее и требовательнее к чистоте речи, крупные точнее и тяжеловеснее. Правило: не экономьте на модели, если запись важная.
Фактор второй: язык и специфика речи
Универсальный движок — компромисс: на распространённых языках он силён, на редких и на сильном акценте ошибки растут. Специализированные модели под конкретный язык (например, GigaAM для русского) дают качество выше универсалов — это заметно на именах, терминах и цифрах.
Фактор третий: чистота записи
Шум, эхо, несколько человек в одном микрофоне — главный источник ошибок. Плохая запись испортит любую модель: сначала звук, потом текст. И фактор режима: локальная обработка не режет длину и не требует интернета, облачная снимает вопросы с железом.
Как это выглядит на практике
Локальный сервис на Whisper: файл на входе — готовый текст на выходе, полуторачасовая лекция расшифровывается, «пока вы пьёте чай»; короткие записи бесплатны, полная версия — разовая плата. Это честная цена за контроль над своими файлами.
Точность без вашей настройки
PostZavod выбирает модель за вас: русская речь идёт через GigaAM на своём GPU-сервере, английская — через свой конвейер с переводом на русский. На выходе — не черновик, а посты для Telegram в вашем стиле письма. Транскрибация — 1 токен за минуту видео, полный прогон (статья + серия постов) — 2 токена; новым аккаунтам — 200 токенов бесплатно, без карты.