Что такое транскрибация нейросетью и зачем она нужна
Транскрибация аудио и видео нейросетью — это автоматическое превращение звуковой дорожки в текст с помощью модели распознавания речи. В августе 2026 года это уже не «магия», а понятный конвейер: звук очищается, нарезается на фрагменты, модель переводит каждое слово в текст, а дополнительный алгоритм умеет подписать, кто из спикеров говорил. На выходе получается файл — чистый текст, субтитры с таймкодами или структурированный JSON. Главная модель в этой области — Whisper от OpenAI, выпущенная в конце 2022 года и с тех пор ставшая стандартом де-факто; вокруг неё выросла целая экосистема быстрых реализаций и облачных сервисов.
Расшифровка аудио нужна везде, где есть речь, которую неудобно переслушивать заново: подкасты, лекции, интервью, судебные заседания, звонки продажников, медицинские диктовки. Распознавание речи снимает рутину — час записи превращается в текст за минуты, который потом можно сократить в саммари, перевести на другой язык или отдать агенту для выборки фактов. Ниже: как устроен процесс под капотом, сравнение подходов, пошаговая инструкция, форматы, длинные файлы, галлюцинации и приватность — без хайпа и выдуманных цифр.
Как работает распознавание речи нейросетью?
Современное распознавание речи устроено как преобразование звука в последовательность токенов — тех же «кусков слов», из которых состоит текст в больших языковых моделях. Whisper, описанный в статье «Robust Speech Recognition via Large-Scale Weak Supervision» (Radford et al., arXiv:2212.04356), — это модель типа encoder-decoder. Энкодер превращает мел-спектрограмму звука (по сути, визуальное представление частот во времени) в набор внутренних признаков, а декодер по этим признакам последовательно «дописывает» текст, попутно расставляя знаки препинания и определяя язык.
Ключевое слово в названии статьи — weak supervision: модель обучали на 680 тысячах часов аудио из интернета, большая часть которого размечена неточно. Это дало необычную устойчивость к шуму, акцентам, фоновому мусику и разному качеству записи — Whisper справляется там, где старые системы ломались. Семейство моделей состоит из нескольких размеров: tiny, base, small, medium, large — чем больше, тем точнее, но и требовательнее к железу. Версия large-v3, вышедшая в конце 2023 года, по официальной карте модели даёт на 10–20% меньше ошибок, чем large-v2, и поддерживает 99 языков — русский входит в их число.
Важно понимать разницу: Whisper только переводит речь в текст. Он не знает, кто говорит, — для этого нужна отдельная задача диаризации (о ней ниже). И он не «понимает» смысл — это делает уже языковая модель, которой вы скармливаете готовый транскрипт.
В октябре 2024 года OpenAI выпустила Whisper large-v3-turbo — урезанную до 809 млн параметров версию, которая работает в 4–8 раз быстрее large-v3 ценой потери около 0,5 процентного пункта точности. Для большинства задач это лучший компромисс скорости и качества. А в 2025 году на смену Whisper пришли модели нового поколения — gpt-4o-transcribe и gpt-4o-mini-transcribe, построенные уже на базе GPT-4o: они лучше определяют язык и допускают меньше ошибок, а mini-версия стоит вдвое дешевле классического whisper-1.
Техническая деталь, важная на практике: Whisper обрабатывает аудио скользящими окнами по 30 секунд. Внутри этих окон модель удерживает контекст и расставляет знаки препинания, а между окнами внутренний алгоритм склеивает результат. На записях дольше получаса с тихими паузами склейка иногда «съезжает» — модель может перескакивать на другой язык или повторять один и тот же фрагмент по кругу. Поэтому даже локально длинный файл надёжнее резать на куски по 10–30 минут. Вторая особенность: помимо задачи транскрибации (transcribe) Whisper умеет делать translate — переводить иностранную речь сразу на английский. Качество этого встроенного перевода заметно хуже, чем у отдельной нейросети-переводчика, поэтому правильно делать в два этапа: сначала чистая расшифровка на языке оригинала, затем перевод отдельной моделью.
Как выбрать модель и сервис для расшифровки аудио?
Способов запустить транскрибацию три: развернуть Whisper на своём железе, дёргать облачный API или воспользоваться готовым сервисом без кода. У каждого свои плюсы, минусы и цена — выбор зависит от объёма, бюджета и требований к приватности.
| Подход | Плюсы | Минусы | Цена (август 2026) | Доступ из РФ |
|---|---|---|---|---|
| Свой Whisper (whisper.cpp, faster-whisper) | Бесплатно, полная приватность, работает офлайн | Нужен GPU/CPU, настройка, свои мощности | 0 ₽ (только железо) | Полный |
| OpenAI API (whisper-1, gpt-4o-transcribe) | Точность «из коробки», не нужно железо | Платёж за рубеж, данные уходят на серверы | $0,006/мин (≈22 ₽/ч); mini — $0,003/мин (pricing) | Через посредников |
| Яндекс SpeechKit | Топовая точность на русском языке, оплата в ₽, диаризация «из коробки» | Дороже, привязка к экосистеме | ≈$0,013/мин (≈78 ₽/ч) (pricing) | Полный |
| Сбер SaluteSpeech | FSTEC-сертификация, для гос/медицины, оплата в ₽ | Меньше языков, в основном RU/EN | По запросу (developers.sber.ru) | Полный |
| No-code сервисы (субтитры в редакторах, боты) | Не нужна установка, всё в браузере | Ограничения бесплатных тарифов, водяные знаки | Бесплатно или подписка | Зависит от сервиса |
Для русского языка важный нюанс: базовый large-v3 на русском работает достойно, но Community-бенчмарки показывают, что дообученные версии снижают ошибку заметно — например, модель whisper-large-v3-russian уменьшает word error rate с ~9,8% до ~6,4% на тестовом наборе. На чистом русском в студийном качестве разница между моделями небольшая; на шумных записях, звонках и диалектах преимущество дообучения и специализированных сервисов (SpeechKit, SaluteSpeech) становится существенным. Чистых официальных цифр «точность на русском» единого стандарта нет — поэтому сравнивайте на своём наборе аудио, а не на маркетинговых графиках.
Правило выбора: приватные/чувствительные данные (медицина, юриспруденция) → свой Whisper или FSTEC-сертифицированный SaluteSpeech. Разовые задачи и быстрые субтитры → облачный API или no-code. Много русского языка в продакшене → SpeechKit.
Как распознать речь за 5 шагов
Инфографика ниже показывает весь конвейер целиком — от сырого аудио до готового файла с таймкодами.
Независимо от того, запускаете вы Whisper локально или шлёте файл в API, процесс состоит из одних и тех же шагов.
- Подготовьте аудио. Конвертируйте в моно, частоту 16 кГц, формат MP3 64 kbps или WAV — этого достаточно для распознавания и резко уменьшает размер. Обрежьте тишину в начале и конце: именно она чаще всего провоцирует галлюцинации модели. Шумоподавление (например, через ffmpeg или RNNoise) повышает точность на записях с улицы.
- Выберите модель и сервис. Под задачу:
large-v3-turboдля баланса скорости и качества на своём ПК, OpenAI API — если не хочется возиться с железом, SpeechKit — для массового русского. Определитесь с языком заранее: модели справляются лучше, когда язык указан явно, а не определяется автоматически. - Запустите расшифровку. Локально:
whisper.cppилиfaster-whisperодной командой. Через API — POST-запрос с файлом. Для файлов длиннее лимита (у OpenAI это 25 МБ) заранее нарежьте аудио на 10-минутные чанки с перекрытием в пару секунд — иначе середина фразы разрежется и пострадает точность. - Очистите транскрипт. Прогоните текст глазами на типичные ошибки: числа, имена собственные, термины. Whisper склонен «угадывать» знаки препинания и иногда вписывает фразу, которой не было (галлюцинации на тишине и музыке). Если нужна диаризация — добавьте Pyannote, чтобы подписать реплики спикеров.
- Экспортируйте в нужном формате. Чистый TXT — для чтения и саммари, SRT/VTT — для субтитров к видео, JSON с таймкодами сегментов — для дальнейшей программной обработки и поиска по моментам.
Один и тот же прогон Whisper может выдать сразу несколько форматов: флаг --output_format поддерживает txt, srt, vtt, json, tsv — выбирайте под конечную задачу (Emory Libraries, обработка Whisper). Конкретные команды выглядят примерно так: локально через whisper.cpp — ./main -m models/ggml-large-v3-turbo.bin -f audio.wav -osrt -of transcript (ключ -osrt сразу пишет субтитры), через API OpenAI — один POST-запрос с полем response_format=srt, а через pydub длинный файл режется вызовом AudioSegment.from_file("podcast.mp3")[i*600000:(i+1)*600000] на десятиминутные куски по миллисекундам. Минимальная автоматизация — и конвейер работает автономно.
Где транскрибация даёт больше всего пользы
Не все записи одинаково выгодно расшифровывать. Выгоды больше там, где аудио длинное, возвращаться к нему неудобно, а текст нужен для дальнейшей работы. Практические сценарии и разумные под них настройки:
| Сценарий | Объём | Лучшая связка | Формат | Что делать с текстом |
|---|---|---|---|---|
| Подкаст / интервью | 40–90 мин | API + diarization | TXT + JSON с таймкодами | Саммари, главы с минутами, посты для соцсетей |
| Лекция / вебинар | 60–120 мин | large-v3-turbo локально | TXT → саммари | Конспект с тезисами, вопросы для повторения |
| Звонки продаж / саппорт | 5–30 мин | SpeechKit или API | JSON + метки спикеров | Вытащить договорённости и следующие шаги |
| Интервью для статьи | 20–60 мин | API + Pyannote | TXT с подписями реплик | Цитаты с атрибуцией «кто сказал» |
| Субтитры для видео | 5–30 мин | large-v3-turbo + word-timestamps | SRT / VTT | Заливка на YouTube, перевод субтитров |
| Медицинская / юридическая диктовка | 1–10 мин | SaluteSpeech (FSTEC) | TXT под протокол | Внесение в карту/протокол с проверкой |
Самая высокая отдача — на стыке «длинное аудио» и «нужен не сам текст, а выводы из него». Часовой подкаст в чистом виде мало кто перечитает, а вот саммари с таймкодами глав и подборкой цитат — это уже готовый контент для рассылки и постов. Интервью на 40 минут руками расшифровывать полтора часа; нейросеть делает это за минуты, а агент за ещё минуту собирает из транскрипта структуру статьи с цитатами.
Считайте экономику сами: ручная расшифровка одного часа аудио у профессионального транскрибатора стоит 1000–2000 ₽ и занимает 3–4 часа рабочего времени. API при $0,006/мин обойдётся примерно в 20–25 ₽ за тот же час и сработает за пару минут — разница в стоимости около 50–80×, а в скорости ещё больше. Локальный Whisper на свободном железе вообще бесплатен, и именно это сочетание цены и скорости и есть главное окно возможностей: то, что раньше было отдельной платной услугой, теперь делается скриптом за копейки.
Второе окно — доступность. Субтитры, сделанные из расшифровки, делают контент пригодным для тех, кто смотрит без звука (а это, по разным оценкам, 40–80% просмотров в соцсетях), и для людей с нарушениями слуха. Так что один и тот же транскрипт закрывает сразу и маркетинговую, и accessibility-задачу. Полноценная озвучка текста нейросетью идёт в обратную сторону и нужна, когда готовый текст превращают в аудиоверсию — например, для podcast-формата статьи.
Как сделать диаризацию и таймкоды для субтитров?
Сам по себе Whisper не различает спикеров — он выдаёт сплошной текст. Если в записи говорят двое или четверо, без диаризации получится мешанина реплик. Задача диаризации — ответить на вопрос «кто говорил когда», разбив аудио на участки по голосам. Де-факто стандарт в open-source — связка Pyannote.audio + faster-whisper: Pyannote находит границы реплик и метит спикеров («SPEAKER_00», «SPEAKER_01»), а Whisper транскрибирует каждый сегмент. На выходе — текст, где каждая реплика подписана.
Таймкоды нужны не только для подписи спикеров, но и для субтитров. Здесь вступают в игру форматы:
- TXT — голый текст без разбивки. Подходит для последующего перевода или саммаризации.
- SRT (SubRip) — субтитры с порядковым номером, временами начала и конца каждой строки. Стандарт для видеоредакторов и плееров.
- VTT (WebVTT) — веб-аналог SRT, используется в HTML5-видео и на YouTube.
- JSON — каждый сегмент с таймкодами, уверенностью модели и языком; удобен для программной обработки и поиска по ключевым моментам.
Whisper отдаёт таймкоды на уровне сегментов (обычно по несколько секунд), а не отдельных слов. Для пословного выравнивания, когда таймкод нужен на каждое слово (например, для караоке-субтитров или синхронизации с видеорядом), используют дополнительные инструменты — whisper.cpp и faster-whisper поддерживают word-level timestamps через соответствующие опции. На практике для 90% задач сегментных таймкодов хватает с головой.
Лайфхак: если субтитры нужны для YouTube или соцсетей, не пытайтесь вписать всю расшифровку в
.srt«как есть». Прогоните транскрипт через языковую модель с запросом «разбей на строки по 7–10 слов с учётом смысла» — субтитры станут читаемыми, а не «прыгающими» по середине фразы.
Что делать с длинными файлами и галлюцинациями?
Две главные беды транскрибации — объём и выдумки. Обе решаются, но требуют понимания.
Длинные файлы. API OpenAI принимает файлы до 25 МБ (документация OpenAI Community). На практике это примерно 10–15 минут записи в хорошем качестве или около часа при сжатии до MP3 64 kbps. Для часового подкаста файл режут на чанки библиотекой pydub с разрезанием по паузам тишины — так фразы не рвутся посередине. Локальный Whisper жёсткого лимита на длину не имеет, но обрабатывает аудио окнами по 30 секунд: внутренний механизм склейки обычно работает, но на очень длинных и тихих записях может «съехать» с языка или начать повторять текст. Поэтому даже локально длинные файлы имеет смысл резать на 10–30-минутные части.
Галлюцинации. Это самая изученная проблема Whisper. Исследование «Careless Whisper: Speech-to-Text Hallucination Harms» (Koenecke et al., FAccT 2024, arXiv:2402.08021) показало: примерно в 1% транскрипций модель вписывает фразы, которых в аудио не было, и около 38% таких выдумок содержат вредоносный или выдуманный контент. Главный триггер — тишина в начале и конце файла, а также музыка без речи. В медицинских и юридических контекстах, где расшифровку используют как доказательство или вносят в карту пациента, это критично: агентство Associated Press и Cornell прямо предупреждали о случаях в больницах (Cornell News, 2024).
Меры защиты — практические и понятные:
- Обрезайте тишину и музыку до и после речи — это убирает главный триггер.
- Включайте обнаружение отсутствия речи (Voice Activity Detection) и не отправляйте «пустые» куски модели.
- Прогоняйте ответ через вторую модель или языковую модель для сверки: если в тексте появились фразы, которых не может быть в вашем домене, — это галлюцинация.
- Для критичных применений не используйте расшифровку как единственный источник истины — сверяйте с оригиналом.
Как сохранить приватность и отдать текст агенту?
Транскрибация — это часто чувствительные данные: внутренние звонки, юридические консультации, медицинские диктовки, собеседования. Поэтому вопрос «где обрабатывается мой аудио» — не косметический. Три уровня:
- Полностью локально. Свой Whisper на своей машине или сервере — аудио никуда не уходит. Максимум приватности, подходит для персональных данных и NDA. Цена — своё железо и настройка.
- Облачный API с политикой хранения. OpenAI по официальной политике не обучает модели на данных, присланных через API (в отличие от ChatGPT). Но данные физически проходят через зарубежные серверы — для некоторых регуляторов и это недопустимо.
- Российский облачный сервис. Яндекс SpeechKit и Сбер SaluteSpeech обрабатывают данные на территории РФ, оплата в рублях, SaluteSpeech имеет сертификат ФСТЭК для информационных систем — этого требует законодательство для государственных и ряда корпоративных систем.
Когда текст готов, начинается самое полезное — работа с ним. Расшифрованный транскрипт можно сразу отдать AI-агенту: агент примет документ, разобьёт длинный текст на смысловые блоки, сделает конспект с тезисами и таймкодами, переведёт, вытащит договорённости из звонка или превратит часовое интервью в структуру для статьи. На платформе AgentHere агенты умеют принимать документы и работать с длинным контекстом — вам не нужно вручную копировать куски текста. Полезно помнить и про срок хранения: у облачных сервисов аудио обычно удаляется через несколько часов или дней после обработки, но при работе по NDA безопаснее включить явное удаление сразу после получения транскрипта или вообще держать конвейер на собственной инфраструктуре.
Обратная задача — озвучка текста нейросетью — решается теми же сервисами в обратную сторону (text-to-speech), а голосовые помощники объединяют оба направления в единый голосовой интерфейс: распознали речь пользователя → обработали → озвучили ответ.
Транскрибация в 2026 году — это зрелая технология, доступная любому: бесплатный Whisper на ноутбуке, облачный API за копейки или российский сервис с оплатой в рублях. Выберите подход под свой объём и требования к приватности, обрежьте тишину, проверьте результат — и час аудио станет текстом, с которым можно работать дальше.
Готовы превратить записи в текст и сразу отдать их агенту на обработку? Соберите своего агента на AgentHere — без кода, за пару минут.
Источники
- OpenAI Whisper — репозиторий и документация модели — https://github.com/openai/whisper
- Robust Speech Recognition via Large-Scale Weak Supervision (Radford et al., 2022) — https://arxiv.org/abs/2212.04356
- OpenAI Whisper large-v3 — карта модели (Hugging Face) — https://huggingface.co/openai/whisper-large-v3
- OpenAI Whisper large-v3-turbo — карта модели (Hugging Face) — https://huggingface.co/openai/whisper-large-v3-turbo
- Introducing next-generation audio models (gpt-4o-transcribe) — https://openai.com/index/introducing-our-next-generation-audio-models/
- OpenAI API Pricing — https://platform.openai.com/docs/pricing
- Careless Whisper: Speech-to-Text Hallucination Harms (Koenecke et al., FAccT 2024) — https://arxiv.org/abs/2402.08021
- Cornell News: AI speech-to-text hallucinations — https://news.cornell.edu/stories/2024/06/ai-speech-text-can-hallucinate-violent-language
- Whisper API: загрузка файлов больше 25 МБ (OpenAI Community) — https://community.openai.com/t/whisper-api-how-to-upload-file-that-larger-than-25mb/693285
- pydub — библиотека для обработки аудио — https://github.com/jiaaro/pydub
- whisper.cpp — реализация Whisper на C/C++ — https://github.com/ggerganov/whisper.cpp
- faster-whisper + Pyannote: диаризация спикеров — https://github.com/SYSTRAN/faster-whisper/discussions/99
- Яндекс SpeechKit — распознавание речи, тарифы — https://cloud.yandex.ru/docs/speechkit/pricing
- Сбер SaluteSpeech — платформа распознавания речи — https://developers.sber.ru/portal/products/smartspeech
- Emory University Libraries — обработка файлов и форматы вывода Whisper — https://guides.libraries.emory.edu/c.php?g=1442123&p=10711508