Dictoria← На главную

Как расшифровать аудио в текст.

Опубликовано

Суть: Расшифровка аудио в текст — это прогон записи через программу распознавания речи: вы отдаёте файл, получаете текст и вычитываете его. Разбираем шаги, форматы, сроки и типовые причины плохого результата.

Расшифровка аудио в текст делается так: запись отдают программе распознавания речи, она возвращает сплошной текст, а человек его вычитывает и разбивает на абзацы. Час записи на обычном ноутбуке обрабатывается за минуты, а не за часы, и почти всё время уходит уже на правку, а не на саму расшифровку. Ниже — что происходит по шагам, какие файлы годятся и из-за чего чаще всего получается плохой результат.

Что вообще происходит при расшифровке

Программа не «слышит слова» так, как их слышите вы. Она разбивает звук на очень короткие отрезки, смотрит, какие звуки в них укладываются, и подбирает наиболее вероятную цепочку слов — с опорой на то, как эти слова обычно идут друг за другом в языке. Поэтому знакомую речь на чистом звуке она разбирает почти без ошибок, а редкую фамилию или термин из вашей области может услышать как похожее обычное слово.

Отсюда два практических следствия. Первое: качество результата определяется качеством записи сильнее, чем любыми настройками, — и это то немногое, на что вы можете повлиять заранее. Второе: расшифровка всегда даёт черновик. Имена, числа и термины проверяет человек, и закладывать время на вычитку надо сразу, а не надеяться, что «в этот раз обойдётся».

Как получить текст из записи: шаги

  • Найдите исходный файл записи. Чем ближе к оригиналу, тем лучше: пересланная в мессенджере копия обычно сжата сильнее.
  • Откройте программу распознавания и добавьте файл — перетаскиванием или кнопкой выбора.
  • Выберите модель распознавания, если программа это позволяет: маленькая быстрее, крупная точнее на сложном звуке.
  • Запустите обработку и дождитесь результата. Прогресс обычно виден по кускам записи, а не одной полосой «ждите».
  • Скопируйте готовый текст или сохраните его текстовым файлом — в Dictoria это txt или md — и переходите к вычитке.

Если файлов несколько, их обычно ставят в очередь и обрабатывают подряд: это удобнее, чем запускать по одному и ждать у экрана. В Dictoria, например, в список добавляют до двадцати пяти файлов сразу.

Какие форматы принимаются

Практически всё, что пишут диктофоны, телефоны и программы для звонков. Dictoria принимает файлы с расширениями wav, mp3, m4a, aac, flac, ogg, oga, opus, aiff, а также видео mp4 и mov — из видео берётся звуковая дорожка.

Формат сам по себе на точность почти не влияет, а вот степень сжатия влияет: запись, дважды пережатая ради экономии места, звучит глуше, и распознавание на ней хуже. Если есть выбор, берите исходник, а не пересланную копию.

Сколько времени занимает час записи

Час записи на обычном ноутбуке обрабатывается примерно за двадцать минут — втрое быстрее, чем длится сама запись. На четырёх часах это примерно час двадцать. Цифра зависит от процессора, размера модели и от того, чем ещё занят компьютер: крупная модель на слабой машине может идти медленнее реального времени.

Проверять это стоит не по обещаниям, а на своём файле: возьмите запись минут на пять, засеките время обработки и умножьте на двенадцать — получите честную прикидку для часа именно на вашей машине.

Что делать с длинной записью

Ничего особенного — современные программы режут её сами. У движков распознавания есть предел длительности, за которым время счёта растёт быстрее самой записи. Поэтому длинную запись режут на куски, и хорошие программы делают это по паузам, а не по таймеру: рез посреди слова теряет его в обоих кусках.

В Dictoria куски получаются примерно по две минуты, а записи короче пяти минут не режутся вовсе. Для вас это выглядит как обычная обработка с прогрессом — просто занимает столько, сколько занимает.

Запись на два-три часа — обычный случай: она делится сама и обрабатывается примерно за час. Единственное, что стоит знать заранее: у задания есть предохранитель по времени СЧЁТА — в Dictoria это шесть часов работы над одной записью. Ограничение не на длительность записи, а на то, сколько программа готова над ней трудиться: на медленной машине в него упирается запись длиннее примерно восемнадцати часов.

Из-за чего получается плохой результат

  • Тихий звук. Диктофон лежал далеко или в кармане — распознавание «додумывает» слова по обрывкам. Лечится только перезаписью, обработкой громкости помогает слабо.
  • Несколько говорящих разом. Перебивания и наложение голосов — самое тяжёлое для любой программы: в этих местах текст придётся править руками.
  • Фоновый шум. Улица, кафе, вентиляция, музыка. Ровный гул мешает меньше, чем чужая речь на фоне: чужую речь программа честно пытается распознать.
  • Термины и имена. Редкие фамилии, названия препаратов, внутренние сокращения — проверяйте их в тексте отдельно, программа подставит похожее обычное слово.
  • Сильно сжатая копия. Голосовое сообщение, пересланное несколько раз, звучит хуже оригинала — берите исходник.

Что делать с готовым текстом

Расшифровка аудио в текст почти всегда приходит сплошным полотном без абзацев — это нормально и правится за несколько минут. Порядок, который экономит время: сначала разбейте текст на смысловые куски, потом прочитайте подряд и поправьте имена, числа и термины, и только в конце наводите стиль. Обратный порядок заставляет переделывать одно и то же.

Если запись нужна не целиком, а ради решений и договорённостей — выпишите их отдельным списком сразу после вычитки. Через день сделать это по тексту будет заметно дольше, чем по свежей памяти.

Где это делает Dictoria

Dictoria — программа для Windows, которая расшифровывает записи прямо на вашем компьютере: файл никуда не отправляется. Интернет нужен трижды и только за этим: скачать модель распознавания, проверять лицензию — не чаще раза в девяносто дней — и получать обновления. Она же умеет голосовой ввод: диктовку сразу в активное окно. Лицензия разовая, 2990 ₽, без подписки; возврат возможен, пока ключ не активирован.

Чего она не делает, чтобы не было сюрприза: не размечает реплики по говорящим — текст приходит единым потоком; сборки для macOS нет. Если для вашей задачи важно именно разделение по ролям, это нужно решать другими средствами.

Цена — 2990 ₽ один раз, без подписки; установщик и оплата — страница покупки и скачивания.

Коротко

  • Расшифровка аудио в текст — это прогон файла через программу распознавания и последующая вычитка: черновик даёт программа, точность наводит человек.
  • Качество записи важнее настроек: тихий звук и наложение голосов портят результат сильнее, чем выбор модели.
  • Час записи расшифровывается примерно за двадцать минут, но цифра зависит от компьютера и модели — проверьте на своём пятиминутном файле.
  • Длинные записи программа режет сама по паузам; записи короче пяти минут не режутся.
  • Сначала абзацы, потом имена и числа, стиль — в последнюю очередь.