Сырая расшифровка — сплошной поток букв без знаков. Читать и тем более публиковать такое нельзя. Хорошая новость: современные модели расставляют пунктуацию сами. Разбираю, как получить текст, который не стыдно открыть, — и бесплатно.
Модель, которая ставит знаки сама
Whisper — нейросеть-трансформер encoder-decoder от OpenAI, обученная на огромных массивах аудио. Актуальная версия v3 работает лучше и с меньшим числом ошибок. Модели делятся на English-only (сразу переводят на английский) и мультиязычные; размеры — от крошечной (39 млн параметров) до large. В живом тесте на русском: «ошибок нет, знаки препинания всё на месте», плюс таймкоды, где в аудио звучит каждая фраза. Качество, оговаривают, напрямую зависит от чистоты самого аудио.
Вариант простой: веб-интерфейс бесплатно
Тот же Whisper крутится в бесплатном веб-интерфейсе на Hugging Face: можно записать звук с микрофона, загрузить файл, перевести или даже скормить ссылку на YouTube-ролик. Единственная плата за бесплатность — очередь: в тесте заявка стояла шестой, и время обработки зависело от нагрузки.
Вариант без очереди: Colab и три строки кода
Для множества файлов автор советует Google Colab: меняете рантайм на GPU (бесплатно выделяется T4), ставите openai-whisper и ffmpeg, загружаете mp3-файлы — и цикл расшифровывает их все, сохраняя txt рядом. Фактически три строки кода. Нюанс: файлы в Colab временные — после закрытия рантайма удаляются. Хотите свой экземпляр веб-интерфейса без очереди — форкается на ваш аккаунт, но уже на платном тарифе.
Пунктуация без кода и очередей
Свой скрипт — это контроль, но и ответственность: рантаймы, форматы, конвертации. PostZavod отдаёт сразу читаемый текст — расшифровка с пунктуацией и абзацами, таймкодами и готовыми постами для Telegram в вашем стиле письма. Транскрибация — 1 токен за минуту видео, полный прогон (статья + серия постов) — 2 токена; новым аккаунтам — 200 токенов бесплатно, без карты.