Что такое дубляж и субтитры видео нейросетью
Дубляж видео нейросетью — это автоматическая локализация готового ролика на другой язык: ИИ расшифровывает звуковую дорожку, переводит текст и либо навешивает субтитры, либо синтезирует новую речь и подставляет её вместо оригинальной. По состоянию на август 2026 года задача «перевести видео» решается двумя маршрутами — субтитры (распознавание речи → машинный перевод → файл SRT) и дубляж (распознавание → перевод → синтез речи TTS, иногда с клонированием голоса и подгонкой артикуляции). На вход подаётся любое видео с речью, на выходе — ролик, понятный русскоязычному зрителю.
Эта статья — про локализацию уже существующего видео. Если нужно создать ролик с нуля, см. гайд по генерации видео нейросетью; если просто озвучить готовый текст — материал про озвучку текста нейросетью; если перевести текстовый документ — гайд по переводу текста нейросетью. Ниже — разбор конвейера, сравнение реальных сервисов и пошаговая инструкция от извлечения аудио до готового MP4.
Как устроен перевод видео нейросетью?
Локализация видео — это не одна модель, а цепочка из четырёх этапов. Понимать её нужно хотя бы для того, чтобы понимать, за что вы платите в сервисах вроде HeyGen или Rask AI и где можно сэкономить, собрав конвейер самостоятельно.
- ASR (Automatic Speech Recognition) — распознавание речи. Извлекается звуковая дорожка, модель превращает её в текст с таймкодами. Де-факто стандарт в августе 2026 года — открытая модель OpenAI Whisper, в частности дистиллированная версия
large-v3-turbo(декодер урезан с 32 слоёв до 4, поэтому работает в разы быстрее оригинала при сравнимом качестве), она поддерживает 99+ языков, включая русский (GitHub openai/whisper). Whisper бесплатен (лицензия MIT), работает локально и без VPN. - Перевод. Расшифрованный текст (по предложениям или целиком) переводится на целевой язык. Здесь работает всё, что описано в материале про перевод текста нейросетью: LLM-переводчик держит контекст всего ролика и согласует терминологию лучше, чем классический статистический MT. Для субтитров важно переводить не слова, а смысловые блоки с привязкой к таймкодам — иначе строки не уложатся в темп речи.
- Синтез речи (TTS) — только для дубляжа. Переведённый текст озвучивается нейронным голосом; при необходимости голос клонируется у оригинального спикера, чтобы сохранить тембр и подачу. Технологии TTS на русском подробно разобраны в гайде по озвучке текста нейросетью — Silero, Yandex SpeechKit, SaluteSpeech, ElevenLabs.
- Сборка и синхронизация. На этапе субтитров — это наложение SRT поверх видео (burn-in, «вшитые» субтитры) или упаковка как отдельной дорожки (sidecar, переключаемые). На этапе дубляжа — это микширование новой речи с оригинальным шумом/музыкой и, в продвинутом варианте, липсинк (lip-sync): ИИ перерисовывает движения губ так, чтобы они совпадали с новой дорожкой.
Практическое правило: субтитры — это этапы 1 + 2 + 4 (без синтеза речи), дубляж — все четыре. Поэтому субтитры всегда дешевле и быстрее, а дубляж всегда дороже, но даёт ролик, который можно смотреть «без чтения».
Отдельно — про тайминги субтитров. Распознанная Whisper строка ещё не годится для показа: её нужно разбить на читаемые блоки по 1–2 строки (обычно до 42 символов в строке) и проверить скорость чтения — для русского комфортная норма около 12–18 символов в секунду. Если строка мелькает быстрее, зритель не успевает прочесть; если медленнее — subtitles «наезжают» друг на друга. Большинство редакторов SRT (Aegisub, Subtitle Edit) показывают CPS (characters per second) и подсвечивают проблемные строки. Для дубляжа этот этап не нужен — там новая речь сама задаёт длину фразы.
И про ложные срабатывания ASR. Whisper (как и любая модель распознавания речи) склонен к «галлюцинациям» на тишине, длинных паузах и музыкальных вставках: модель может «додумать» фразу там, где человек промолчал. Поэтому после расшифровки обязательно вычитайте куски без речи — обычно именно там появляются фантомные строки вроде «Спасибо за просмотр» или «Подпишитесь на канал». Бороться просто: включить обнаружение пауз (--condition_on_previous_text в разумных пределах) и вручную удалить пустые или мусорные блоки перед переводом.
Важно: каждый этап можно выполнить отдельно и бесплатно — Whisper даёт расшифровку, LLM-переводчик — перевод, бесплатный TTS — голос, FFmpeg — сборку. Платные сервисы (ElevenLabs Dubbing, HeyGen, Rask AI) ценны тем, что склеивают всю цепочку в один клик и добавляют липсинк. Дальше — сравнение.
Какие нейросети делают субтитры и дубляж?
Ниже — сводка инструментов, которые массово применяются для локализации видео по состоянию на август 2026 года. Цены и лимиты у зарубежных сервисов меняются часто, поэтому проверяйте актуальные на официальных страницах.
| Сервис | Что делает | Русский | Доступ из РФ | Особенность |
|---|---|---|---|---|
| OpenAI Whisper | ASR, расшифровка в SRT/VTT | Да | Да (локально, бесплатно) | Open-source, MIT, 99+ языков |
| ElevenLabs Dubbing | Полный дубляж + клон голоса | Да | Ограниченно (VPN) | 90+ языков, авто-клонирование спикера |
| HeyGen Video Translate | Дубляж + липсинк | Да | Ограниченно (VPN) | 175+ языков, подгонка губ |
| Rask AI | Дубляж + липсинк + несколько спикеров | Да | Ограниченно (VPN) | 130+ языков, мульти-диктор |
| YouTube auto-dubbing | Автодубляж загруженных роликов | Да | Да (через YouTube) | 27 языков, бесплатно для авторов |
| Яндекс Браузер | Субтитры + дубляж онлайн-видео | Да | Да | Перевод видео прямо в браузере |
Коротко о каждом
OpenAI Whisper — фундамент всей отрасли. Модель large-v3-turbo выпущена в октябре 2024 года и остаётся рабочей лошадкой: она дистиллирована с large-v3 (декодер 32→4 слоя), поэтому быстрее оригинала, поддерживает 99+ языков и работает локально примерно от 4 ГБ VRAM (GitHub openai/whisper, discussion #2363). Через обёртки faster-whisper или whisper.cpp её гоняют даже на CPU. Whisper бесплатно отдаёт таймкоды и сразу экспортирует SRT/VTT — то есть этапы 1 и часть этапа 4 закрывает.
ElevenLabs Dubbing Studio склеивает весь конвейер: загрузили видео → получили ролик на одном из 90+ языков с автоматическим клонированием голоса оригинального спикера (сохраняются тембр, высота и подача без ручной настройки) (ElevenLabs Dubbing). Версия Dubbing v2 добавила качественную синхронизацию по времени и липсинк (ElevenLabs Blog, Dubbing v2). Бесплатный тариф даёт 10 000 кредитов в месяц (примерно соответствует нескольким минутам дубляжа), далее идут платные тарифы (ElevenLabs Pricing); из РФ нужен обход блокировок и оплата в валюте.
HeyGen Video Translate делает ставку на «идеальный липсинк»: синхронизирует переведённую речь с движениями рта так, чтобы совпадение было естественным, — это шаг дальше простого аудиодубляжа (HeyGen Translate). Поддерживается 175+ языков. Тариф Creator стартует примерно от $29/мес, липсинк-дубляж расходует около 5 кредитов за минуту видео, есть бесплатный план до трёх роликов в месяц (HeyGen Pricing). Доступ из РФ ограничен.
Rask AI — отдельная русская страница и сильный упор на локализацию «под ключ»: 130+ языков, клонирование голоса, липсинк и поддержка нескольких спикеров в одном ролике (Rask AI, Russian Video Translator). По оценкам обзоров, ИИ-перевод видео обходится примерно в $2–20 за минуту против $500–2000 за минуту у классического студийного дубляжа — то есть экономия до ~98% (technology.org, 2026). Из РФ — также через VPN.
YouTube auto-dubbing — бесплатный автодубляж для авторов: YouTube генерирует переведённую звуковую дорожку автоматически. К февралю 2026 года охват расширен до 27 языков, технология основана на проекте Aloud (YouTube Blog, YouTube Help). Это самый простой путь, если ваше видео уже на YouTube и язык оригинала поддержан.
Яндекс Браузер решает задачу с другой стороны — для зрителя: умеет показывать переведённые субтитры (включая русский) для онлайн-видео и даже накладывать голосовой дубляж, без установки отдельных сервисов (Яндекс Браузер, настройки перевода). Бесплатно и работает из РФ напрямую.
Как сделать дубляж видео и субтитры: пошагово
Ниже — рабочий конвейер, который можно собрать из бесплатных и доступных в России инструментов. Он описывает маршрут субтитров полностью и дубляжа — до этапа синтеза речи (который подробно разобран в материале по озвучке текста).
- Подготовьте видео и извлеките аудио. Чтобы распознавание прошло быстро и точно, достаньте звуковую дорожку в формате, который «ест» Whisper: моно, 16 кГц, 16-bit PCM. Команда FFmpeg:
ffmpeg -i input.mp4 -vn -acodec pcm_s16le -ar 16000 -ac 1 audio.wav(DigitalOcean tutorial). Если ролик длиннее 30 секунд, Whisper нарежет его на чанки автоматически. - Расшифруйте речь в SRT. Запустите
whisper audio.wav --model large-v3-turbo --language en --output_format srt— на выходе появитсяaudio.srtс таймкодами (GitHub openai/whisper). Флаг--languageускоряет работу и снижает число галлюцинаций. Для русского оригинала укажите--language ru. Если в ролике говорят несколько человек и нужно знать, кто именно, добавьте диаризацию (разделение спикеров) — например, через модель Pyannote; она расставит меткиSPEAKER_00,SPEAKER_01, которые потом пригодятся и для дубляжа (разным дикторам — разные голоса). - Переведите субтитры. Скачайте SRT, откройте в любом редакторе или скармливайте LLM-переводчику блоками по 20–30 строк с инструкцией «сохраняй нумерацию и таймкоды, переводи на русский, не разбивай строки». LLM-перевод держит контекст ролика и терминологию лучше классического MT — подробности в гайде по переводу текста нейросетью. Проверьте имена собственные и числа: они — главный источник ошибок.
- Соберите видео с субтитрами. Два варианта. Burn-in («вшить» в кадр, нельзя отключить):
ffmpeg -i input.mp4 -vf "subtitles=sub.srt" -c:a copy out.mp4. Sidecar (переключаемые, рекомендовано для YouTube/Vimeo):ffmpeg -i input.mp4 -i sub.srt -c copy -c:s srt out.mp4(FFmpeg Cookbook, FFmpeg Wiki). Для плееров и соцсетей, где переключение недоступно, берите burn-in. - Для дубляжа — синтезируйте русскую речь. Переведённый текст озвучивается TTS-сервисом на русском: бесплатно и офлайн — Silero, в облаке из РФ — Yandex SpeechKit или SaluteSpeech, для клонированного «голоса как у оригинала» — ElevenLabs (через VPN). Детали и сравнение — в гайде по озвучке текста нейросетью. Сохраняйте паузы между репликами — они потребуются при монтаже.
- Смикшируйте дорожку и при желании сделайте липсинк. Замените оригинальную речь на новую, оставив фоновый шум/музыку (через
-mapв FFmpeg или видеоредактор). Липсинк — перерисовку губ под новую дорожку — на август 2026 года качественно делают HeyGen, Rask AI и ElevenLabs; локальных бесплатных аналогов студийного уровня пока нет. Если идеальная артикуляция не критична, остановитесь на этапе 5: голос поверх картинки уже даёт смотримый дубляж.
Лайфхак для русского перевода: если в ролике есть термины, имена или аббревиатуры, заранее составьте глоссарий и вставьте его в промпт LLM-переводчика («переведи на русский, термин X оставляй как Y»). Это убирает 80% правок на финальной вычитке.
Что выбрать — субтитры, дубляж или живого переводчика?
Однозначного победителя нет: формат зависит от бюджета, жанра и того, где ролик будет жить. По состоянию на август 2026 года расклад такой:
| Параметр | Субтитры (ИИ) | Дубляж (ИИ) | Человек-переводчик |
|---|---|---|---|
| Стоимость за минуту | ~$0–1 | ~$2–20 | ~$15–50 (перевод), дубляж от $100 (HeyGen Blog) |
| Скорость (10-минутный ролик) | 5–15 минут | 20–60 минут | 2–5 дней |
| Качество русского | Хорошее, требует вычитки | Хорошее, иногда «роботизированное» | Эталонное, с игрой интонаций |
| Доступность для глухих и слабослышащих | Да (субтитры читаются) | Нет (нужны отдельные субтитры) | Да |
| Сохранение голоса спикера | Да | Да при клонировании; иначе — новый голос | Да при студийной записи |
| Липсинк (движение губ) | Не нужен | Часто есть (HeyGen, Rask AI) | Да, при полноценном дубляге |
| Доступность инструментов из РФ | Высокая (Whisper, Яндекc) | Средняя (часть сервисов — через VPN) | Высокая (рынок переводчиков) |
Короткий вывод. Для обучающих роликов, докладов и контента «для чтения» берите субтитры — это дёшево, точно и доступно слабослышащим. Для рекламы, Reels и контента, который смотрят «на ходу» без звука или с ожиданием родной речи, — дубляж. Для договоров, медицинских или юридических материалов, где цена ошибки высока, — человека, а ИИ используйте как черновик.
Цифры в таблице — ориентир, они сильно зависят от длины ролика, выбранного сервиса и тарифа. Так, обзор рынка за 2026 год оценивает классический студийный дубляж фильма в одну языковую версию свыше $100 000, тогда как ИИ-альтернативы снижают стоимость до единиц долларов за минуту (technology.org, 2026).
Чем опасно клонирование голоса и когда нужен человек?
Липсинк и клонирование голоса — самые мощные, но и самые чувствительные этапы. В августе 2026 года консенсус индустрии сводится к четырём правилам, которые стоит соблюдать независимо от юрисдикции: согласие, прозрачность, компенсация и раскрытие (Resemble.ai, MagicHour, 2026). Звучат они так: клонируйте голос только того, кто явно и письменно согласился на конкретное использование; не выдавайте синтезированную речь за запись живого человека; если голос «унаследован» от платного диктора — договоритесь о компенсации; обязательно помечайте ролик как ИИ-дубляж. Это не формальность: FTC США уже фиксирует случаи мошенничества с клонированными голосами и ведет отдельную программу защиты от таких злоупотреблений (FTC, Voice Cloning Challenge).
Проще говоря: не клонируйте голос клиента, коллеги или знаменитости «потому что удобно». Используйте дубляж либо со своего собственного голоса (с согласия — есть), либо с готовых нейронных голосов из библиотеки сервиса, либо с явного письменного разрешения правообладателя. Это страховка и от репутационных, и от юридических рисков — регулирование в этой области ужесточается по всему миру.
Отдельно — про качество. ИИ-дубляж в 2026 году отлично справляется с информационной речью (лекция, обзор, новостной ролик), но всё ещё проигрывает человеку там, где важна эмоция: художественный фильм, рекламный сторителлинг, аудиокнига с несколькими ролями. Сарказм, ирония, шёпот, крик, акценты — пока слабое место синтеза. Поэтому для «проектного» контента (курс, продукт-видео, YouTube-обзор) дубляж нейросетью — рабочий вариант; для кино и рекламы высокого полёта — только как черновик под студийную доработку.
Если сомневаетесь — начните с субтитров. Это самый «безопасный» формат: нет риска с голосом, нет рисков с липсинком, а зритель с плохим слухом или иностранным языком всё равно получит доступ. Дубляж подключайте, когда точно понимаете задачу и получили согласие на использование голоса.
Как AgentHere помогает с переводом видео
AgentHere — это маркетплейс ИИ-агентов, которых можно собрать без кода. Полный дубляж с липсинком сегодня делают специализированные сервисы (HeyGen, Rask AI, ElevenLabs), но текстовую половину конвейера — расшифровку, перевод, подготовку SRT и вычитку — удобно делегировать агенту. Агент на AgentHere может: принять ссылку на видео или аудиофайл, прогнать его через инструмент распознавания речи, перевести расшифровку с сохранением таймкодов, проверить термины по глоссарию и выдать готовый SRT и перевод. Для повторяющихся задач (например, еженедельная локализация роликов канала) такого агента достаточно собрать один раз.
Чтобы попробовать, зарегистрируйтесь и соберите агента на базе существующих инструментов распознавания речи и перевода — без программирования, через форму. Для разовой задачи подойдёт готовый агент из маркетплейса. Это не заменит студийный дубляж художественного фильма, но закроет 80% повседневных кейсов: курс, обзор, вебинар, продуктовое видео.
Типичный сценарий на AgentHere: вы загружаете ролик и пишете агенту «расшифруй, переведи на русский, подготовь SRT и сократи длинные строки до 42 символов». Агент прогоняет аудио через инструмент распознавания речи, передаёт текст в LLM-переводчик с глоссарием, разбивает по таймкодам и возвращает готовый файл субтитров — плюс короткую сводку, где возможны неточности (имена, числа, термины). Дальше вы либо вкладываете SRT в ролик сами одной командой FFmpeg (шаг 4 выше), либо при желании дорабатываете дубляж в специализированном сервисе. Такой связкой удобно локализовать целые плейлисты и каналы: агента настраиваешь один раз, а ролики скармливаешь пачками.
Источники
- OpenAI Whisper (репозиторий, лицензия MIT) — https://github.com/openai/whisper
- Релиз модели large-v3-turbo (дистилляция large-v3) — https://github.com/openai/whisper/discussions/2363
- ElevenLabs Dubbing Studio (90+ языков, авто-клонирование голоса) — https://elevenlabs.io/dubbing-studio
- ElevenLabs Dubbing v2 (тайм-синхрон и липсинк) — https://elevenlabs.io/blog/introducing-dubbing-v2
- ElevenLabs Pricing (бесплатный тариф, кредиты) — https://elevenlabs.io/pricing
- HeyGen Video Translate (175+ языков, липсинк-дубляж) — https://www.heygen.com/translate
- HeyGen Pricing (тариф Creator, расход кредитов) — https://www.heygen.com/pricing
- Rask AI — русскоязычный видео-переводчик (130+ языков) — https://www.rask.ai/tools/video-translator/russian-video-translator
- Обзор: ИИ-перевод видео $2–20/мин против $500–2000/мин (2026) — https://www.technology.org/2026/02/18/best-10-ai-video-translation-tools-in-2026-features-quality-and-real-world-performance/
- YouTube Blog: автодубляж расширен до 27 языков — https://blog.youtube/news-and-events/youtube-auto-dubbing-expressive-speech/
- YouTube Help: Automatic dubbing — https://support.google.com/youtube/answer/15569972
- Яндекс Браузер: перевод и субтитры для видео — https://browser.yandex.com/help/en/search-and-browse/translators-settings
- FFmpeg Cookbook: burn-in и sidecar субтитров — https://ffmpeg-cookbook.com/en/articles/subtitles/
- FFmpeg Wiki: HowToBurnSubtitlesIntoVideo — https://trac.ffmpeg.org/wiki/HowToBurnSubtitlesIntoVideo
- DigitalOcean: генерация субтитров Whisper + FFmpeg — https://www.digitalocean.com/community/tutorials/how-to-generate-and-add-subtitles-to-videos-using-python-openai-whisper-and-ffmpeg
- Этика клонирования голоса: согласие и прозрачность (Resemble.ai) — https://www.resemble.ai/resources/ai-voice-cloning-regulation-legal-updates-concerns
- Голосовое клонирование: законы и этика 2026 (MagicHour) — https://magichour.ai/blog/ai-voice-cloning-laws-and-ethics
- FTC: предотвращение вреда от клонирования голоса — https://www.ftc.gov/policy/advocacy-research/tech-at-ftc/2023/11/preventing-harms-ai-enabled-voice-cloning