Диаризация — это разметка записи по говорящим: не просто «что сказано», а «кто именно сказал». Без неё расшифровка интервью превращается в кашу, с ней — готовый протокол. Разбираю на живом примере: подкаст 29,7 МБ, длиннее 32 минут, три участника.
Зачем это нужно
Разделение по спикерам востребовано у всех, кто работает с чужой речью: сценаристы, юристы, журналисты, писатели, стенографисты. Запись интервью без диаризации — монолит текста, где невозможно понять, где чья реплика. С диаризацией — диалог с ясными ролями.
Как проходит обработка большого файла
Живая демонстрация: файл 29,7 МБ отправляется в обработку и идёт заметно дольше коротких записей — файл путешествует между серверами туда и обратно. Нюансы платформы: Telegram режет загрузку на 20 МБ и текстовые файлы на 4096 знаков, поэтому сервисы держат собственные серверы под большие файлы. Совет по формату: MP3 обрабатывается быстрее и стабильнее остальных.
Разделение голосов и имена
После расшифровки бот выделил трёх спикеров — A, B и C — и разложил реплики по очереди. Дальше метки переименовываются в реальные имена: «Спикер A» становится Иваном, B — Дарией, C — Семёном. Результат экспортируется в Word — готовый документ для работы.
Цена вопроса
Экономика таких сервисов: короткие записи (в примере — до 20 минут) доступны бесплатно для теста, всё длиннее — по подписке. Для разового интервью это нормально; для регулярной работы с записями копеечным способ не бывает — либо подписка, либо свой пайплайн.
Диаризация без подписок
PostZavod делает разделение спикеров сразу: запись целиком расшифровывается с консистентными «Спикер N» по таймкодам — интервью, эфиры и подкасты превращаются в текст с ясными ролями, а дальше — в посты в вашем стиле письма. Транскрибация — 1 токен за минуту видео, полный прогон (статья + серия постов) — 2 токена; новым аккаунтам — 200 токенов бесплатно, без карты.