Шумная запись — главный враг расшифровки: открытая форточка, слабый микрофон ноутбука, эхо в переговорке. Распознавание на таком тексте сыплется. Решение — почистить звук до текста, и это бесплатно.
Инструмент: нейросеть для улучшения речи
Существуют бесплатные улучшатели голосовых записей: нейросеть убирает шумы и приводит голос к виду «как будто записано в профессиональной студии». На сайте есть демо: послушайте оригинал и улучшенную версию — разница слышна сразу, особенно на записях с реальными помехами.
Лимиты бесплатного тарифа
Условия вполне щедрые: размер файла — до 500 МБ, длительность — до 1 часа, до 3 часов обработки в день. Форматы — только MP3 и WAV. Для доступа нужна регистрация (почта или Google-аккаунт) и решение пазл-капчи.
Цикл очистки на примере
Живой пример: видео, записанное в Camtasia. Извлекаем звуковую дорожку (экспорт «только звук») — получаем M4A, который сервис не примет. Онлайн-конвертером переводим в MP3 — и загружаем. Дальше ползунок «оригинал/улучшено» показывает разницу, результат скачивается в WAV и возвращается в проект или уходит на расшифровку.
Эффект тем заметнее, чем грязнее исходник: запись с шумами и помехами преображается сильнее всего. А дополнительно на той же платформе — проверка микрофона, запись подкастов и автоматическая транскрипция.
Очистили — и дальше?
Чистый звук — половина задачи: дальше текст должен превратиться в результат. PostZavod принимает запись (в том числе неидеальную — распознавание русской речи идёт на GigaAM) и возвращает готовые посты для Telegram в вашем стиле письма. Транскрибация — 1 токен за минуту видео, полный прогон (статья + серия постов) — 2 токена; новым аккаунтам — 200 токенов бесплатно, без карты.