Как перевести аудио в текст на компьютере и онлайн

Статьи про фотоаппараты

Нужно превратить интервью, лекцию, диктофонную запись, голосовое сообщение или звуковую дорожку видео в редактируемый текст. Для этой задачи подходят три разных подхода: автоматическая транскрибация готового файла, голосовой ввод в реальном времени и ручная расшифровка с удобным плеером. Они требуют разной подготовки и дают разный результат, поэтому начинать стоит не с выбора сайта, а с понимания исходника.

Ниже разобраны восемь воспроизводимых способов. Первый рассчитан на запись, которую полезно сначала привести в порядок: в АудиоМАСТЕРе можно убрать лишние фрагменты, выровнять громкость, подавить заметный шум и сохранить рабочую копию, а само распознавание выполнить в Speech2Text. Такой двухэтапный процесс особенно уместен для интервью, подкаста или старой диктофонной записи, где перед распознаванием нужна аудиоподготовка. Остальные варианты позволяют работать напрямую в браузере, локально через Whisper или вручную в oTranscribe.

Автоматическая расшифровка не отменяет контроль результата. Имена людей и брендов, числа, аббревиатуры, профессиональные термины, фразы на фоне музыки и реплики, наложенные друг на друга, нужно сверять с оригиналом. Для монтажа видео дополнительно важны тайм-коды и субтитровый экспорт: если после расшифровки предстоит доводить SRT, пригодится материал TopFotograf про синхронизацию и автоматизацию субтитров.

Содержание
  1. Какой способ перевода аудио в текст выбрать
  2. Что подготовить до расшифровки
  3. Способ 1. АудиоМАСТЕР + Speech2Text: подготовить запись и получить автоматическую расшифровку
  4. Шаг 1. Откройте копию записи
  5. Шаг 2. Исправьте только явные проблемы звука
  6. Шаг 3. Сохраните рабочую копию
  7. Шаг 4. Загрузите файл в Speech2Text
  8. Как проверить результат первого способа
  9. Способ 2. Google Документы: надиктовать текст через микрофон
  10. Пошаговая работа
  11. Способ 3. Speechpad: распознавать микрофон или подключить модуль транскрибации
  12. Вариант A: обычная диктовка
  13. Вариант B: модуль «Транскрибация»
  14. Способ 4. Teamlogs: загрузить интервью, встречу или видео и отредактировать стенограмму
  15. Как сделать транскрибацию
  16. Способ 5. Whisper: локально расшифровать файл через командную строку
  17. Установка
  18. Запуск русского распознавания
  19. Как проверить локальный результат
  20. Способ 6. Speechnotes: выбрать между диктовкой и транскрибацией готового файла
  21. Для готового файла
  22. Для живой речи
  23. Способ 7. Dictation.io: быстро превратить живую речь в текст
  24. Порядок действий
  25. Способ 8. oTranscribe: расшифровать запись вручную без переключения между плеером и редактором
  26. Как работать
  27. Как проверить расшифровку перед использованием
  28. 1. Имена, названия и термины
  29. 2. Числа и единицы измерения
  30. 3. Границы реплик и спикеры
  31. 4. Тишина, музыка и неречевая часть
  32. 5. Пунктуация и абзацы
  33. 6. Тайм-коды
  34. Типичные ошибки: причина, проверка и исправление
  35. Сервис «слышит» не те слова
  36. После шумоподавления ошибок стало больше
  37. Спикеры перепутаны
  38. В Google Документах, Speechpad или Dictation.io не включается микрофон
  39. Whisper не запускает файл
  40. Получился текст, но он не подходит для субтитров
  41. Текст сохранён только внутри сайта
  42. Как выбрать способ под конкретную задачу
  43. Чек-лист перед экспортом готового текста
  44. Вопросы, которые возникают при переводе аудио в текст
  45. Нужно ли сначала переводить MP3 в WAV?
  46. Можно ли получить хороший текст из записи с музыкой?
  47. Что лучше для интервью: DOCX или SRT?
  48. Нужно ли сохранять слова-паразиты и повторы?
  49. Как понять, что автоматическая расшифровка недостаточно надёжна?
  50. Итог
  51. Предложить модель для рейтинга

Какой способ перевода аудио в текст выбрать

Готовый MP3, WAV, M4A или видеоролик лучше загружать в сервис, который принимает файлы напрямую: Speech2Text, Teamlogs или Speechnotes. В таком процессе не требуется воспроизводить запись через динамики в реальном времени. Сервис получает исходный файл, обрабатывает его на сервере и возвращает текст; у Speech2Text и Teamlogs есть также разделение по спикерам и тайм-коды.

Google Документы, Dictation.io и базовый режим Speechpad работают прежде всего как голосовой ввод через микрофон. Они хороши для надиктовки заметок или для ситуации, когда человек сам повторяет услышанное из записи. Использовать такой способ как замену прямой загрузке часового интервью неудобно: документ заполняется с той же скоростью, с какой звучит речь, а качество зависит от микрофона, акустики помещения и способа подачи звука.

Whisper отличается от облачных сервисов тем, что открытая версия запускается на собственном компьютере. После установки модель обрабатывает локальный файл через командную строку и сохраняет TXT, SRT, VTT, TSV, JSON или JSONL. Это требует настройки Python и FFmpeg, зато исходник не приходится отправлять в сторонний веб-сервис. Для регулярной обработки больших коллекций записей и автоматизации такой вариант заметно гибче обычной веб-формы.

oTranscribe вообще не распознаёт речь автоматически. Он объединяет плеер и редактор, поддерживает горячие клавиши и вставку временных меток. Этот путь медленнее, но остаётся полезным, когда запись слишком шумная для автоматики, нужно дословно проверить цитаты или данные нельзя передавать облачному сервису. Ручная расшифровка также удобна как финальный этап проверки сложных фрагментов после машинного распознавания.

Способ Что обрабатывает Как создаётся текст Что особенно полезно
АудиоМАСТЕР + Speech2Text Готовое аудио или звук из видео Подготовка локально, распознавание в облаке Очистить и сократить исходник перед транскрибацией
Google Документы Речь с микрофона Голосовой ввод в браузере Надиктовка заметок и текстовых набросков
Speechpad Микрофон, аудио и видео Распознавание через Chrome Речевая диктовка и транскрибация с ручным проговариванием
Teamlogs Аудио, видео, ссылки Автоматическая облачная транскрибация Спикеры, тайм-коды, редактор, DOCX/XLSX/SRT
Whisper Локальные медиафайлы Локальная модель через командную строку Автоматизация, субтитры, работа без отправки файла в веб-сервис
Speechnotes Речь с микрофона, аудио и видео Диктовка или автоматическая обработка файла Быстрый веб-процесс и экспорт субтитров
Dictation.io Речь с микрофона Распознавание в реальном времени Простой голосовой блокнот без установки
oTranscribe Аудио и видео Ручной набор рядом с плеером Точная ручная проверка и приватная работа с локальным файлом

Что подготовить до расшифровки

Сначала сохраните исходную запись отдельно и работайте с копией. Это особенно важно перед обрезкой, шумоподавлением и нормализацией громкости: при чрезмерной обработке ухудшается разборчивость согласных, а вместе с шумом удаляются тихие окончания слов. Исходник нужен как эталон, с которым можно сверить спорное место и при необходимости повторить обработку с другими параметрами.

Прослушайте по 20–30 секунд в начале, середине и ближе к концу файла. Проверьте, не пропадает ли один канал, не меняется ли уровень громкости, нет ли постоянного гула, щелчков, сильного эха или музыки поверх голоса. Если речь в целом разборчива, не стоит «лечить» звук агрессивными эффектами. Для распознавания важнее сохранить естественный тембр и отчётливые согласные, чем сделать запись субъективно более приятной.

Для интервью отметьте число участников и выпишите правильное написание имён, названий компаний, моделей техники и терминов. Этот короткий словарь пригодится при проверке: автоматическая система часто записывает редкое имя как знакомое слово, а иностранное название — по звучанию. Если в материале важны точные суммы, даты, номера объективов, выдержки или значения диафрагмы, их лучше отдельно сверить по звуку, а не переносить в публикацию автоматически.

Длинную запись удобно делить на логические части только тогда, когда выбранный инструмент имеет ограничения или когда материал действительно состоит из отдельных эпизодов. Искусственное дробление каждых пяти минут усложняет сборку текста и создаёт лишние стыки. В Teamlogs допускаются файлы длительностью до 300 минут и размером до 1,5 ГБ, а Speech2Text на текущей странице сервиса не устанавливает ограничения по длительности и размеру, поэтому деление ради самой загрузки там обычно не требуется.

Практическое правило: сначала добейтесь того, чтобы речь можно было уверенно понимать на обычной громкости, затем запускайте распознавание. Шумоподавление, перевод в другой формат и обрезка — подготовительные операции, а не само преобразование речи в текст.

Способ 1. АудиоМАСТЕР + Speech2Text: подготовить запись и получить автоматическую расшифровку

АудиоМАСТЕР — настольный аудиоредактор для Windows. Он умеет открывать и записывать звук, вырезать участки, менять громкость, применять эквалайзер и подавление шума, конвертировать аудио и извлекать звуковую дорожку из видео. Важное ограничение для этой инструкции: программа сама не выполняет распознавание речи. Поэтому её роль — привести исходник к удобному состоянию и сохранить копию, после чего файл передаётся в Speech2Text.

Стоимость: АудиоМАСТЕР — 690 ₽ за текущую лицензию на странице продукта; в Speech2Text есть бесплатный план 0 ₽ с 180 минутами при регистрации, персональные платные планы начинаются с 500 ₽ в месяц.

Поддержка русского языка: интерфейс АудиоМАСТЕРа русскоязычный; Speech2Text распознаёт русский и более 90 других языков.

Интерфейс АудиоМАСТЕРа с волновой формой и выделенным фрагментом записи
В АудиоМАСТЕРе запись редактируется по волновой форме: ненужный участок можно выделить, прослушать и удалить до отправки на распознавание.

Шаг 1. Откройте копию записи

Запустите АудиоМАСТЕР и нажмите «Открыть файл». Для видео используйте стартовую команду «Извлечь звук из видео»: программа позволяет выбрать ролик, указать аудиоформат, при необходимости обрезать нужный отрезок и сохранить звуковую дорожку. Для обычного MP3, WAV или другого аудио достаточно прямого открытия файла.

Сразу проверьте длительность и прослушайте несколько фрагментов. Если в начале записано несколько минут подготовки микрофона, а в конце — пустота или разговор, который не должен попадать в текст, удалите эти части. На волновой форме выделите ненужный участок и используйте «Вырезать». Чем меньше неречевого материала отправляется в систему распознавания, тем проще затем проверять результат.

Шаг 2. Исправьте только явные проблемы звука

При постоянном фоновом шуме откройте «Эффекты» → «Удаление шума и восстановление» → «Подавление шума». Настраивайте эффект по короткому фрагменту с речью и каждый раз сравнивайте его с исходником. Сильное подавление способно сделать голос металлическим и сгладить тихие звуки, поэтому задача не в стерильной дорожке, а в лучшей разборчивости слов.

Если один участник записан заметно тише остальных, выровняйте громкость до распознавания. Это полезнее, чем просто поднять общий уровень всей дорожки: общий подъём вместе с тихой речью усиливает и фон. После обработки снова прослушайте места с тихими согласными, шипящими и окончаниями слов.

Шаг 3. Сохраните рабочую копию

Откройте «Файл» → «Сохранить как…». Для промежуточной копии подходят WAV или FLAC, когда важна сохранность качества и размер файла не критичен. Для удобной передачи можно выбрать MP3 с разумным битрейтом. Не перезаписывайте единственный оригинал кнопкой обычного сохранения: подготовленную версию лучше назвать отдельно, например interview_clean, чтобы исходник оставался доступен для контрольного прослушивания.

На странице АудиоМАСТЕРа заявлена работа в Windows 11, 10, 8, 7 и XP; текущая версия продукта — 3.58. Это локальный этап: обработка и сохранение выполняются на компьютере. Интернет понадобится уже на следующем шаге, когда подготовленная копия будет загружена в Speech2Text.

Шаг 4. Загрузите файл в Speech2Text

Интерфейс Speech2Text с выбором языка, количества спикеров и загрузкой файла
В Speech2Text перед запуском можно выбрать язык и число говорящих либо оставить автоматическое определение, затем загрузить аудио или вставить ссылку.

На странице Speech2Text нажмите «Загрузить файл» и выберите подготовленную копию. Сервис принимает, в частности, MP3, WAV, FLAC, OGG, M4A, AAC и OPUS, а также умеет обрабатывать видео. Язык можно поставить «Русский» или оставить автоматическое определение. Для разговора нескольких людей укажите число спикеров либо используйте автоматический режим.

Нажмите «Распознать» и дождитесь завершения. Результат содержит абзацы, пунктуацию, временные метки и реплики спикеров. Участников можно переименовать, а текст — сверять с записью через интерактивный плеер. Для обычной статьи или конспекта удобно скачать DOCX, для видеомонтажа — SRT.

Как проверить результат первого способа

Начните не с чтения всего документа, а с трёх контрольных участков, которые были сложными в оригинале: тихая реплика, фраза на фоне шума и место, где собеседники перебивают друг друга. Если после очистки они стали понятнее и в тексте меньше ошибок, подготовка была полезной. Если слова исчезли или стали распознаваться хуже, вернитесь к исходнику и сделайте менее агрессивную обработку.

Для интервью отдельно переименуйте «Спикер 1», «Спикер 2» и другие метки до экспорта. Иначе после скачивания придётся искать их по всему документу. Числа, фамилии и названия проверьте по аудио вручную, даже когда остальной текст выглядит безошибочно.

Плюсы и минусы
можно обрезать лишнее, выровнять громкость и уменьшить постоянный шум до распознавания;
оригинал обрабатывается локально, а в облако отправляется только подготовленная копия;
Speech2Text разделяет говорящих, ставит тайм-коды и экспортирует текст и субтитры.
это двухэтапный процесс: АудиоМАСТЕР не заменяет сервис распознавания;
АудиоМАСТЕР работает на Windows;
для облачной транскрибации запись загружается на сервер Speech2Text.

Способ 2. Google Документы: надиктовать текст через микрофон

Голосовой ввод Google Документов рассчитан на речь, поступающую с микрофона. Это не форма для загрузки готового MP3: штатный сценарий — открыть документ, включить «Голосовой ввод» и говорить. Поэтому способ особенно удобен для лекционных заметок, наброска статьи, подписи к фотографии, сценария ролика или ручной расшифровки, когда пользователь слушает запись в наушниках и повторяет её своими словами в микрофон.

Стоимость: отдельная плата за голосовой ввод не требуется; создание документов в Google Документах доступно пользователю с аккаунтом Google, а платные планы Workspace относятся к дополнительным корпоративным возможностям.

Поддержка русского языка: русский есть в списке языков голосового ввода.

Google Документы с открытой панелью голосового ввода и микрофоном
После команды «Инструменты» → «Голосовой ввод» рядом с документом появляется отдельная панель микрофона.

Пошаговая работа

  1. Откройте новый документ в актуальной версии Chrome, Edge или Safari. Установите курсор в место, где должен появляться текст.
  2. Выберите «Инструменты» → «Голосовой ввод». Появится окно с микрофоном.
  3. В списке языка выберите русский. При первом запуске разрешите браузеру использовать микрофон.
  4. Нажмите значок микрофона и говорите обычным темпом. Чтобы остановить ввод, нажмите микрофон ещё раз.
  5. Исправляйте неправильно распознанные слова сразу в документе либо после завершения фрагмента. Текст остаётся обычным редактируемым документом.

Google отдельно указывает, что обработкой речи управляет браузер, после чего текст передаётся в Документы. В рабочем или учебном аккаунте доступ к функции определяется настройками администратора. Если пункта «Голосовой ввод» нет, сначала проверьте браузер и тип аккаунта, а не разрешение на микрофон.

Для готовой аудиозаписи безопаснее не пытаться одновременно воспроизводить её из динамиков и распознавать тем же компьютером: результат зависит от маршрутизации системного звука и акустики. Более предсказуемая схема — слушать запись в наушниках, останавливать её по фразам и проговаривать содержание в микрофон. Это всё ещё работа в реальном времени, но человек контролирует темп и сразу исправляет термины.

Плюсы и минусы
не нужно устанавливать отдельную программу;
результат сразу находится в документе и готов к редактированию, комментариям и совместной работе;
русский язык поддерживается штатно.
готовый аудиофайл нельзя штатно загрузить в голосовой ввод как источник;
для длинной записи процесс занимает время, сопоставимое с длительностью прослушивания;
в корпоративном аккаунте доступ к функции определяется настройками администратора.

Способ 3. Speechpad: распознавать микрофон или подключить модуль транскрибации

Speechpad, он же «Голосовой блокнот», сочетает диктовку и модуль транскрибации. На главной странице можно вводить речь через микрофон, а кнопка «Транскрибация» открывает панель воспроизведения медиа. Сервис работает с распознаванием в Chrome на Windows, macOS и Linux; для Android и iOS существуют отдельные приложения.

Стоимость: голосовой ввод в блокноте доступен бесплатно; транскрибирование файлов длительностью более 15 минут относится к расширенным возможностям, которые подключаются в личном кабинете. Пакетная обработка более двух файлов относится к отдельным премиум-функциям.

Поддержка русского языка: есть; язык выбирается в интерфейсе блокнота.

Speechpad с выбором русского языка, кнопкой включения записи и полем результата
В Speechpad основной экран объединяет выбор языка, параметры распознавания, кнопку запуска и поле, куда попадает распознанный текст.

Вариант A: обычная диктовка

Откройте Speechpad в Chrome, выберите русский и нажмите «включить запись». Разрешите доступ к микрофону, когда браузер покажет системное уведомление. Говорите короткими смысловыми фразами и следите за «Результирующим полем». Если сервис перестал получать звук, сначала проверьте индикатор микрофона в Chrome и системный вход, а уже затем перезагружайте страницу.

Вариант B: модуль «Транскрибация»

Нажмите «Транскрибация». Для HTML5-аудио или видео Speechpad просит указать URL медиафайла, для YouTube — идентификатор ролика. После настройки запускается воспроизведение и распознавание. Отдельный переключатель «Запускать синхронно с записью» управляет автоматическим совместным стартом.

У Speechpad есть полезный ручной режим: снимите флажок «Запускать синхронно с записью», наденьте наушники и повторяйте услышанные фразы в микрофон. Такой метод помогает с записью, которую автоматическое распознавание понимает плохо. Человек фактически становится промежуточным «редактором звука»: разбирает неясную речь на слух и произносит её более чисто.

Ограничение этого подхода связано с самой архитектурой Speechpad: транскрибация опирается на подачу звука в систему распознавания, а не на современную схему «загрузил файл — получил готовую стенограмму». Для большой коллекции интервью Teamlogs, Speech2Text, Speechnotes или локальный Whisper требуют меньше ручного управления.

Плюсы и минусы
в одном интерфейсе есть диктовка и режим работы с аудио/видео;
ручное проговаривание помогает расшифровывать сложные фрагменты;
русский интерфейс и русское распознавание подходят для локальных материалов.
основной веб-режим распознавания привязан к Chrome;
длинные файлы и пакетная обработка относятся к платным расширениям;
рабочий процесс с готовой записью сложнее прямой загрузки файла в современный облачный транскрибатор.

Способ 4. Teamlogs: загрузить интервью, встречу или видео и отредактировать стенограмму

Teamlogs ориентирован на готовые аудио- и видеофайлы. После загрузки сервис определяет язык, поддерживает разделение речи по спикерам, расставляет тайм-коды и открывает результат во встроенном редакторе. Клик по фрагменту текста переводит воспроизведение к соответствующему месту, поэтому спорную фразу удобно проверять без ручного поиска по всей записи.

Стоимость: первые 15 минут доступны бесплатно после регистрации; базовая оплата — 10 ₽ за минуту, при покупке пакетов цена снижается до 6 ₽ за минуту. Минуты в пакетах не сгорают.

Поддержка русского языка: есть; всего заявлено 78 языков.

Редактор Teamlogs со стенограммой, спикерами, тайм-кодами и аудиоплеером
В редакторе Teamlogs реплики разделены по спикерам и времени, а внизу остаётся плеер для контрольного прослушивания.

Как сделать транскрибацию

  1. Создайте аккаунт и нажмите «Загрузить файл». Сервис принимает распространённые аудио- и видеоформаты, включая MP3, MP4, M4A, OGG, WAV, FLAC, WMA, AAC и WEBM.
  2. Выберите язык или «Авто», затем укажите число спикеров либо оставьте автоматическое определение. Нажмите «Продолжить».
  3. Дождитесь, пока статус обработки сменится с «В обработке» на «Завершено».
  4. Откройте стенограмму. Переименуйте спикеров, исправьте фамилии, числа и специальные термины, прослушивая исходник рядом с текстом.
  5. Экспортируйте результат в DOCX для обычного документа, XLSX для табличной работы или SRT для субтитров.

На текущей странице сервиса указан максимальный размер одного файла 1,5 ГБ и длительность до 300 минут; пакетная загрузка позволяет добавить до десяти файлов одновременно. Для регулярной обработки интервью или записей встреч это важнее, чем большое количество визуальных эффектов: рабочий процесс строится вокруг очереди, проверки и экспорта.

Если речь пойдёт дальше в монтаж, сохраняйте исходную запись вместе с итоговым текстом и SRT. Текст без тайм-кодов удобен для чтения, но для восстановления точной связи с кадром его недостаточно. После редакторской правки субтитров полезно проверить первые и последние реплики каждой сцены на таймлайне.

Плюсы и минусы
прямая загрузка длинных аудио и видео, в том числе пакетами;
разделение по спикерам, тайм-коды и синхронное прослушивание в редакторе;
экспорт в DOCX, XLSX и SRT без промежуточного конвертера.
после тестовых минут дальнейшая обработка оплачивается поминутно;
файл передаётся облачному сервису, что нужно учитывать для закрытых рабочих записей;
автоматическое разделение говорящих всё равно требует проверки на перебиваниях и похожих голосах.

Способ 5. Whisper: локально расшифровать файл через командную строку

Whisper от OpenAI — открытая модель распознавания речи с командным интерфейсом. Она подходит пользователям, которым важны локальная обработка, автоматизация и несколько выходных форматов. В отличие от обычного сайта, здесь сначала устанавливаются Python-пакет и FFmpeg, затем команда запускается для конкретного файла. Код и веса Whisper распространяются по лицензии MIT.

Стоимость: открытая версия Whisper бесплатна; расходы возникают только из-за собственного оборудования или аренды вычислительных ресурсов, когда пользователь сам выбирает такой вариант.

Поддержка русского языка: есть; Russian присутствует в списке языков командного интерфейса.

Терминал с результатом распознавания аудиофайла моделью Whisper и временными метками
У Whisper нет обязательного графического окна: штатный открытый пакет работает из терминала и выводит распознанные сегменты с временными метками.

Установка

Пакет устанавливается командой pip install -U openai-whisper. Для чтения медиаданных нужен FFmpeg, который должен быть доступен в системном пути. В метаданных пакета указана совместимость с Python 3.8–3.13. После установки в терминале появляется команда whisper.

Перед первым большим файлом возьмите короткую минутную копию записи. Так проще убедиться, что FFmpeg видит файл, модель скачалась, русский язык определяется корректно, а результат создаётся в нужной папке. Это практичнее, чем обнаружить ошибку окружения после запуска часовой записи.

Запуск русского распознавания

Для явного выбора русского языка используйте команду вида whisper interview.wav –language Russian –model turbo. Имя файла можно заменить своим. Whisper также умеет определять язык автоматически, но для однородной русскоязычной записи явный параметр делает конфигурацию понятнее и воспроизводимее.

По умолчанию командный инструмент способен сохранить несколько представлений результата. Параметр –output_format принимает TXT, VTT, SRT, TSV, JSON, JSONL или all. Для статьи достаточно TXT; для видеомонтажа выбирайте SRT или VTT; JSON полезен, когда текст дальше обрабатывает скрипт.

Как проверить локальный результат

Откройте TXT и SRT рядом с исходным аудио. Сначала проверьте участки с тишиной, музыкой и перебиваниями: именно там автоматическая модель чаще создаёт лишний текст, повторяет фрагмент или неверно делит сегменты. Для длинной записи полезно искать в тексте заранее известные фамилии и термины и по временным меткам возвращаться к звуку.

Whisper не является готовой системой разметки интервью по именам собеседников. Базовая команда распознаёт речь и сегменты, но не даёт полноценного редакционного интерфейса уровня Teamlogs. Если задача — регулярно переименовывать спикеров, комментировать реплики и делиться стенограммой с коллегами, облачный сервис удобнее. Если задача — локально прогнать сотни файлов и сохранить SRT, командный процесс выигрывает за счёт автоматизации.

Плюсы и минусы
аудиофайл можно обрабатывать локально, не отправляя его в стороннюю веб-форму;
есть TXT, SRT, VTT, TSV, JSON и другие форматы результата;
командный запуск удобно включать в пакетные сценарии и собственные скрипты.
нужно установить Python, пакет Whisper и FFmpeg;
скорость зависит от процессора или видеокарты и выбранной модели;
штатный открытый пакет не даёт готового визуального редактора стенограммы со спикерами.

Способ 6. Speechnotes: выбрать между диктовкой и транскрибацией готового файла

Speechnotes объединяет два режима, которые важно не путать. Dictation Notepad — голосовой блокнот для речи в реальном времени. Отдельный Transcription Service принимает аудио и видео с устройства, ссылки на онлайн-файлы и YouTube, затем возвращает автоматическую расшифровку. Для готовой записи нужен именно второй режим.

Стоимость: диктовка — 0 долларов в месяц; премиум-диктовка без рекламы — 1,9 доллара в месяц; автоматическая транскрибация файлов — 0,1 доллара за минуту по модели pay-as-you-go без обязательной подписки.

Поддержка русского языка: есть; сервис заявляет работу транскрибации со всеми языками, а русский доступен и в голосовом вводе.

Веб-интерфейс Speechnotes с полем заметки, микрофоном и панелью голосовых команд
Speechnotes в режиме диктовки показывает большой текстовый блокнот, кнопку микрофона и подсказки по пунктуации; автоматическая загрузка файлов открывается отдельным разделом Transcribe.

Для готового файла

  1. Откройте раздел Transcribe и войдите через Google — страница автоматической транскрибации требует входа.
  2. Добавьте аудио или видео с устройства либо передайте ссылку на онлайн-источник. Среди перечисленных форматов есть MP3, OGG, WAV, MOV, MP4 и MPEG.
  3. Запустите транскрибацию и дождитесь уведомления о готовности.
  4. Откройте результат в синхронном редакторе: текст можно исправлять во время прослушивания, а переход по фрагменту возвращает к соответствующему месту записи.
  5. Экспортируйте DOCX, TXT или PDF для текста, SRT или VTT — для субтитров.

Speechnotes автоматически добавляет временные метки и поддерживает диаризацию. На странице тарифа отдельно уточнено, что маркировка спикеров входит в транскрибацию на английском; поэтому для русскоязычного интервью не следует рассчитывать на эту функцию без контрольной проверки. Основная ценность режима для русского материала — распознавание, тайм-коды, синхронный редактор и готовые форматы экспорта.

Для живой речи

В режиме диктовки регистрация не обязательна. Откройте блокнот в Chrome, выберите русский, запустите микрофон и говорите. Этот режим бесплатен с рекламой и сохраняет заметки локально в хранилище браузера. Он годится для голосового наброска, но не заменяет автоматическую загрузку часового файла: для записи выбирайте Transcribe.

Плюсы и минусы
один сервис закрывает и живую диктовку, и обработку готовых файлов;
автоматическая транскрибация оплачивается по минутам без ежемесячной подписки;
есть синхронное прослушивание и экспорт текста либо субтитров.
автоматическая обработка готовых записей платная;
для режима Transcribe требуется вход через Google;
точность и разметку спикеров нужно проверять по исходнику, особенно на записи невысокого качества.

Способ 7. Dictation.io: быстро превратить живую речь в текст

Dictation.io — минималистичный голосовой блокнот для Chrome. Он использует Google Speech Recognition, преобразует речь в текст в реальном времени и хранит полученный текст локально в браузере. На странице сервиса в системных требованиях указаны Google Chrome, Windows/macOS/Linux и подключение к интернету.

Стоимость: веб-инструмент запускается без выбора платного тарифа или покупки лицензии.

Поддержка русского языка: есть; «Русский» присутствует в списке поддерживаемых языков.

Dictation.io с русским текстом, кнопкой Start и панелью редактирования
Основное окно Dictation.io — текстовый лист с форматированием и кнопкой Start; распознанный русский текст появляется прямо в редакторе.

Порядок действий

  1. Откройте Dictation.io в Chrome и нажмите Launch Dictation, затем в рабочем блокноте выберите русский язык.
  2. Нажмите Start. Разрешите доступ к микрофону, когда Chrome покажет системное окно.
  3. Говорите обычным темпом. Текст появляется в блокноте по мере распознавания.
  4. После фрагмента остановите диктовку и отредактируйте знаки препинания, имена и числа.
  5. Используйте Copy или Save, чтобы забрать готовый текст из блокнота.

Dictation.io не предназначен для прямой загрузки MP3. Для расшифровки старого интервью его разумно использовать только как инструмент «слушаю и повторяю»: исходник воспроизводится отдельно, пользователь ставит паузу и диктует услышанную фразу. Для коротких голосовых заметок это просто, для часовой беседы — медленно.

На странице сервиса уточняется, что распознанный текст хранится локально в браузере, при этом само распознавание выполняется механизмом Google Speech Recognition. Поэтому формулировка «ничего не покидает компьютер» применима к сохранению текста на стороне Dictation.io, а не к архитектуре всего речевого движка.

Плюсы и минусы
очень короткий путь от микрофона до редактируемого текста;
русский язык поддерживается без дополнительного модуля;
в блокноте есть копирование, сохранение, печать и базовое форматирование.
нет штатной загрузки готового аудиофайла для автоматической расшифровки;
требуются Chrome и подключение к интернету;
для длинной записи ручное проговаривание занимает много времени.

Способ 8. oTranscribe: расшифровать запись вручную без переключения между плеером и редактором

oTranscribe создан именно для ручной расшифровки интервью. В одном окне находятся медиаплеер и редактор текста, поэтому не нужно постоянно переключаться между отдельным проигрывателем и документом. Автоматического speech-to-text в oTranscribe нет: слова набирает человек. Это ограничение одновременно делает сервис полезным как контрольный инструмент для сложных цитат.

Стоимость: бесплатно; проект открыт по лицензии MIT.

Поддержка русского языка: распознавания речи нет, поэтому язык аудио не ограничивается речевой моделью; русский текст вводится вручную обычной клавиатурой.

Рабочее окно oTranscribe с видеоплеером и редактором стенограммы
oTranscribe держит медиаплеер и поле расшифровки на одном экране, а воспроизведением можно управлять горячими клавишами.

Как работать

  1. Нажмите Start transcribing и выберите «Choose audio (or video) file». oTranscribe работает на настольных компьютерах.
  2. Запустите воспроизведение и печатайте текст в правом редакторе. Клавиша Esc ставит запись на паузу и продолжает воспроизведение.
  3. Используйте F1 и F2 для перемотки назад и вперёд, F3/F4 — для изменения скорости. Это позволяет держать руки на клавиатуре и не ловить бегунок мышью после каждой фразы.
  4. Нажимайте Ctrl+J, когда нужна интерактивная временная метка. По ней позднее можно вернуться к соответствующей точке записи.
  5. Экспортируйте готовый текст как Markdown, обычный TXT или внутренний формат oTranscribe; доступна также отправка в Google Drive.

Аудио и стенограмма остаются на компьютере пользователя: медиафайл и текст не покидают устройство. Редактор автоматически сохраняет работу в локальном хранилище браузера; кроме того, Ctrl+S создаёт сохранение вручную. Это не заменяет обычную резервную копию: по окончании работы экспортируйте текст отдельным файлом.

Ручной способ особенно оправдан для юридически или редакционно значимой цитаты, записи с сильным акцентом, фразы на фоне аплодисментов, музыкального фрагмента или нескольких одновременно говорящих людей. Автоматический сервис можно использовать для первичной версии, а oTranscribe — для участков, где нужно услышать каждое слово и точно поставить метку времени.

Плюсы и минусы
медиаплеер и редактор находятся в одном окне;
горячие клавиши ускоряют паузу, перемотку, смену скорости и вставку тайм-кодов;
аудиофайл и текст остаются локально на компьютере.
автоматического распознавания нет;
полная расшифровка длинного интервью требует ручного времени;
после работы нужно самостоятельно экспортировать отдельную резервную копию текста.

Как проверить расшифровку перед использованием

Готовый текст нельзя оценивать только по тому, насколько «гладко» он читается. Нейросеть способна построить грамматически правдоподобную фразу и при этом заменить фамилию, число или термин. Для журналистского интервью, сценария, субтитров, протокола встречи и учебной лекции полезнее проверять по категориям ошибок.

1. Имена, названия и термины

Найдите все фамилии, бренды, модели камер и объективов, географические названия, профессиональные сокращения. Сверьте первое появление каждого слова со звуком, затем приведите одинаковые упоминания к одному написанию. Если собеседник говорит «эс эр тэ», а в документе нужен SRT, редактор должен привести обозначение к принятому виду, а не сохранять случайную фонетическую запись.

2. Числа и единицы измерения

Отдельно проверяйте даты, цены, телефоны, проценты, выдержку, ISO, фокусное расстояние, разрешение, частоту кадров и любые номера. Ошибка «пятнадцать» вместо «пятьдесят» выглядит как обычное слово и легко проходит при беглом чтении. В субтитрах и техническом материале это одна из самых дорогих категорий ошибок.

3. Границы реплик и спикеры

На интервью прослушайте все места, где один человек перебивает другого. При автоматической диаризации встречаются два типичных сбоя: две реплики объединяются под одним именем либо из-за изменившейся громкости появляется лишний спикер. После переименования участников пролистайте стенограмму и убедитесь, что каждому имени действительно соответствует один голос.

4. Тишина, музыка и неречевая часть

Автоматическая модель иногда пытается интерпретировать шум, музыку или далёкий голос как речь. Найдите участки с длинными паузами и заставками. Если в тексте появились фразы, которых в записи нет, удалите их и проверьте соседние временные метки. Для субтитров особенно важно, чтобы такой ложный текст не висел на экране во время музыкальной перебивки.

5. Пунктуация и абзацы

Автоматические точки и запятые помогают читать, но не являются редакционной разметкой. Длинную речь разбивайте на абзацы по смыслу, а не по случайной паузе. В дословной стенограмме сохраняйте смысл и порядок реплик; в конспекте можно сокращать повторы, но такой текст уже не следует выдавать за дословную цитату.

6. Тайм-коды

Для видео откройте несколько временных меток в начале, середине и конце. Они должны приводить к той реплике, к которой относятся. Если после монтажа исходного ролика звук был обрезан, старые тайм-коды больше не совпадут с финальным таймлайном. В таком случае субтитры нужно синхронизировать уже с итоговой версией видео.

Когда расшифровка используется не только как текст, но и как монтажная карта, полезен подход, где слова остаются связаны с медиадорожкой. Отдельно можно посмотреть монтаж видео и подкастов через расшифровку: там текст становится частью самого процесса редактирования медиа.

Типичные ошибки: причина, проверка и исправление

Сервис «слышит» не те слова

Причина: тихая речь, постоянный гул, сильное эхо, музыка поверх голоса или перегруженный сигнал. Проверка: прослушайте тот же фрагмент в наушниках на обычной громкости. Если человеку тоже трудно разобрать согласные, смена транскрибатора не решит исходную проблему полностью. Исправление: вернитесь к копии записи, удалите ненужный фон настолько, насколько это не повреждает голос, либо вручную расшифруйте проблемное место.

После шумоподавления ошибок стало больше

Причина: обработка затронула спектр речи и сделала тихие звуки менее различимыми. Проверка: сравните один и тот же отрезок до и после эффекта. Исправление: отмените обработку и примените более слабое подавление. Именно поэтому исходник нужно хранить отдельно и не перезаписывать.

Спикеры перепутаны

Причина: похожие голоса, перебивания, короткие междометия, резкая смена уровня. Проверка: найдите места смены собеседника и включите синхронное воспроизведение. Исправление: переименуйте участников в редакторе и вручную перенесите спорные реплики. Не полагайтесь на цвет или номер спикера без прослушивания.

В Google Документах, Speechpad или Dictation.io не включается микрофон

Причина: браузеру не выдано разрешение, выбран другой источник звука либо используется неподдерживаемый браузер. Проверка: откройте системные настройки микрофона и разрешения сайта. Google Документы поддерживают актуальные Chrome, Edge и Safari; Speechpad и Dictation.io для веб-распознавания ориентированы на Chrome. Исправление: выберите рабочий микрофон, обновите вкладку и повторно разрешите доступ.

Whisper не запускает файл

Причина: не установлен FFmpeg, команда Whisper недоступна в текущем окружении Python или в пути к файлу есть ошибка. Проверка: сначала выполните whisper –help, затем проверьте короткий WAV из простой папки. Исправление: установите FFmpeg, активируйте то окружение Python, куда установлен пакет, и повторите запуск на тестовом файле. Большой исходник запускайте только после этой проверки.

Получился текст, но он не подходит для субтитров

Причина: экспортирован обычный TXT без временной структуры или строки слишком длинные для экрана. Проверка: откройте SRT/VTT и убедитесь, что в нём есть пары времени начала и окончания. Исправление: повторно экспортируйте SRT из Teamlogs, Speech2Text, Speechnotes или Whisper, затем отредактируйте переносы и синхронизацию в программе для субтитров.

Текст сохранён только внутри сайта

Причина: пользователь закончил правку, но не сделал локальный экспорт. Проверка: убедитесь, что рядом с исходником действительно лежит DOCX, TXT, SRT или другой итоговый файл. Исправление: экспортируйте результат до очистки браузера, удаления проекта или закрытия доступа к аккаунту. Для oTranscribe это особенно важно: локальное автосохранение помогает во время работы, но не заменяет отдельную резервную копию.

Как выбрать способ под конкретную задачу

Сценарий Рациональный выбор Что проверить первым
Шумное интервью на Windows АудиоМАСТЕР + Speech2Text Стало ли лучше слышно тихие слова после обработки
Нужно быстро надиктовать текст Google Документы или Dictation.io Выбран ли русский язык и рабочий микрофон
Нужна расшифровка встречи со спикерами Teamlogs или Speech2Text Правильно ли разделены участники и числа
Нужен локальный пакетный процесс Whisper Работают ли FFmpeg и тестовая команда на коротком файле
Нужны SRT/VTT для видео Whisper, Speech2Text, Teamlogs или Speechnotes Совпадают ли временные метки с финальным монтажом
Запись плохо понимается автоматикой oTranscribe или ручное проговаривание в Speechpad Можно ли уверенно разобрать фразу человеком
Нельзя отправлять исходник в обычный облачный транскрибатор Локальный Whisper или ручной oTranscribe Где физически обрабатывается и хранится файл

Для разовой короткой заметки нет смысла разворачивать локальную модель: голосовой ввод запускается быстрее. Для десятков часов записей ситуация обратная — командная обработка Whisper или пакетная очередь специализированного сервиса снижает количество повторяющихся действий. Для видеопроизводства выбор определяет не только качество распознавания, но и наличие SRT/VTT и точных временных меток.

Когда запись содержит закрытые переговоры, персональные сведения или неопубликованный материал, до загрузки в облако нужно сверить внутренние правила хранения данных и условия выбранного сервиса. Локальная подготовка в АудиоМАСТЕРе не делает последующий облачный этап локальным: после загрузки в Speech2Text файл уже обрабатывает внешний сервис. Whisper и oTranscribe позволяют построить процесс без такой передачи исходника веб-транскрибатору.

Чек-лист перед экспортом готового текста

  • Оригинал сохранён. Рабочая обработанная версия не заменила единственную исходную запись.
  • Имена приведены к одному написанию. Один человек не встречается в документе под двумя вариантами фамилии.
  • Числа сверены по звуку. Проверены даты, суммы, проценты, номера моделей и единицы измерения.
  • Спикеры проверены вручную. На перебиваниях и коротких репликах автоматическая разметка исправлена.
  • Ложный текст на тишине удалён. Музыка, заставки и шум не превратились в вымышленные фразы.
  • Выбран нужный формат. DOCX/TXT — для чтения и редактирования, SRT/VTT — для субтитров, JSON/TSV — для программной обработки, когда она действительно нужна.
  • Есть отдельная локальная копия. Итоговый файл скачан из сервиса и хранится рядом с исходником или в рабочем хранилище.
  • Субтитры сверены с финальным видео. После обрезки ролика старые временные метки не используются без повторной синхронизации.

Вопросы, которые возникают при переводе аудио в текст

Нужно ли сначала переводить MP3 в WAV?

Для большинства рассмотренных сервисов — нет. Speech2Text, Teamlogs и Speechnotes принимают MP3 напрямую, Whisper также читает распространённые форматы через FFmpeg. Перекодирование оправдано, когда исходный контейнер не открывается выбранным инструментом или требуется сделать отдельную рабочую копию после обработки. Простая конвертация MP3 в WAV не восстанавливает детали, уже потерянные при сжатии.

Можно ли получить хороший текст из записи с музыкой?

Можно получить пригодную первичную версию, когда голос заметно громче музыки и остаётся разборчивым. Сложнее всего фрагменты, где вокал, фон и основной спикер находятся на похожем уровне. В таких местах полезно сначала проверить исходник на слух, затем аккуратно уменьшить мешающий фон или расшифровать участок вручную. Нельзя считать гладкий машинный текст доказательством того, что спорная цитата распознана верно.

Что лучше для интервью: DOCX или SRT?

DOCX удобнее для редакторской работы с интервью, заголовками, комментариями и согласованием текста. SRT нужен, когда расшифровка должна стать субтитрами и сохранить связь с временной шкалой видео. Часто разумно экспортировать оба файла: DOCX — для чтения и правок, SRT — для монтажа и проверки времени.

Нужно ли сохранять слова-паразиты и повторы?

Это зависит от назначения документа. Дословная стенограмма сохраняет речевые особенности настолько, насколько они важны для точности цитирования. В читаемом конспекте, протоколе или статье повторения и междометия допустимо убирать после сверки смысла. Главное — не смешивать два режима: сокращённый отредактированный текст не следует обозначать как буквальную расшифровку разговора.

Как понять, что автоматическая расшифровка недостаточно надёжна?

Возьмите три участка по 30–60 секунд: чистый, средний по качеству и самый сложный. Сверьте каждое слово, имя и число. Если на сложном участке теряется смысл, а в среднем регулярно искажаются термины, весь документ требует плотной ручной проверки. Если ошибки единичны и сосредоточены в именах, редакторская вычитка займёт меньше времени, чем полная ручная расшифровка.

Итог

Готовый аудиофайл лучше передавать инструменту, который принимает файл напрямую, а голосовой ввод оставлять для живой диктовки. Для шумной или перегруженной записи на Windows сначала полезно сделать рабочую копию в АудиоМАСТЕРе и только затем распознавать её в Speech2Text. Для встреч со спикерами и экспортом SRT удобен Teamlogs, для локальной автоматизации — Whisper, для браузерной транскрибации с оплатой по минутам — Speechnotes. Google Документы и Dictation.io подходят для речи через микрофон, Speechpad объединяет диктовку и модуль транскрибации, а oTranscribe остаётся точным ручным вариантом для трудных фрагментов.

Независимо от выбранного инструмента, финальный этап один: сохранить оригинал, проверить имена и числа по звуку, исправить спикеров и временные метки, затем экспортировать текст в формат, соответствующий дальнейшей работе. Именно эта проверка превращает машинную первичную версию в стенограмму, которой можно безопасно пользоваться при монтаже, подготовке статьи, субтитров или рабочего документа.

Поделиться с друзьями
Андрей Федоров
Андрей Федоров

Фотография – это целое искусство, где необходима полная самоотдача, недюжинный самоконтроль и безупречное чувство прекрасного. А если вы ещё и желаете досконально разбираться в фототехнике – вам потребуется соответствующее образование и немалый опыт. У меня имеется и то, и другое, ведь я работаю профессиональным фотографом уже около 20 лет. За плечами высшее техническое образование в сфере фототехники, а также подтверждённая профессия «Фотоискусство и диджитал графика» от РГУ имени А. Н. Косыгина. Кроме того, полученные специальности не остановили меня в развитии, и я закончил ещё и несколько платных тематических курсов, существенно подтянув свои знания в сфере фотодела. В конце концов жизненный путь привёл меня к созданию своего сайта, где я делюсь собственным немалым опытом с читателями. Подробнее обо мне...

Оцените автора
( Пока оценок нет )
Топ фотограф
Добавить комментарий