Перейти к содержимому
Назад к блогу
Инструкции

Как создать голосового помощника на ИИ в 2026 году

Пошаговый гайд: как собрать голосовой помощник на ИИ в 2026 году — ASR Whisper, LLM-мозг, TTS с русским голосом, wake-word и latency ниже 500 мс.

AgentHere Team
AgentHere TeamАвтор
Обновлено: 7 августа 2026 г.13 мин чтения
Содержание

Что такое голосовой помощник и можно ли собрать его самому

Голосовой помощник — это программа, которая слышит речь, превращает её в текст, осмысливает его большой языковой моделью и отвечает голосом. В 2026 году такой ассистент больше не монолит «от вендора»: он собирается из трёх отдельных модулей — распознавание речи (ASR), языковая модель (LLM) и синтез речи (TTS). Каждый модуль можно выбрать и заменить самостоятельно. Создать своего голосового помощника сегодня реально и без программирования: «мозгом» служит готовый текстовый агент, а распознавание и синтез речи подключаются как внешние сервисы. Ниже — пошаговый разбор, как собрать такую связку на русском языке, какие модели выбрать под каждый блок и какие здесь есть подводные камни — от задержки ответа до закона о клонировании голоса.

Если вам нужно не строить ассистента, а сравнить готовые (Алиса, Салют, GigaChat), для этого есть отдельный обзор голосовых помощников 2026. Эта статья — про сборку собственного.

Как устроен голосовой помощник?

Архитектура любого современного голосового ассистента — это конвейер из трёх блоков, которые передают друг другу данные по цепочке:

  1. ASR (Automatic Speech Recognition) — распознаёт речь, переводит звук в текст. Часто перед ним стоит отдельный детектор слова-активации (wake-word), который «будит» систему.
  2. LLM (Large Language Model) — «мозг»: получает распознанный текст и генерирует осмысленный ответ. Это та же языковая модель, что работает в текстовом чате.
  3. TTS (Text-to-Speech) — синтезирует ответный текст обратно в голос.

Всё остальное — микрофон, стриминг аудио, очереди, контекст диалога, интеграции с телефонией или умным домом — это обвязка вокруг этих трёх блоков. Поэтому первый шаг сборки — не выбор «какого-то одного продукта», а отдельный подбор модели под каждый этап. На том же принципе устроены и коммерческие voice-AI движки: Retell AI в своём разборе архитектуры прямо описывает этот же трёхступенчатый пайплайн STT → LLM → TTS с двумя слоями оркестрации (Retell AI).

Инфографика: три компонента голосового помощника на ИИ — распознавание речи ASR, языковая модель LLM, синтез речи TTS, август 2026

Главное правило: голосовой ассистент отвечает вслух. Значит, ответ LLM должен быть коротким и связным — без таблиц, маркированных списков и скобок, которые невозможно произнести.

Как выбрать модель распознавания речи (ASR)?

Распознавание речи — фундамент всего помощника: если ASR расслышал неверно, ошибку уже не исправит ни LLM, ни синтез. По состоянию на август 2026 года основной открытый выбор — семейство Whisper от OpenAI. Актуальная версия large-v3 поддерживает 99 языков, включая русский, и даёт на 10–20% меньше ошибок по сравнению с предыдущей large-v2 на широком наборе языков (Hugging Face — openai/whisper-large-v3). Полный список из 99 поддерживаемых языков ведётся в официальном репозитории (openai/whisper на GitHub).

Для быстрого старта есть ускоренные варианты: Whisper large-v3 turbo — урезанная версия, которая распознаёт те же 99 языков, но заметно быстрее и дешевле по вычислениям. На русском хорошо работает и отечественный Vosk (от alpha cephei) — он умеет работать офлайн на слабых устройствах и у Raspberry Pi, что удобно для локальных ассистентов в умном доме.

ASR-решениеРусский языкГде работаетЛатентностьЛицензия / доступ
Whisper large-v399 языков, сильныйОблако или свой сервер (GPU)СредняяОткрытая (MIT-стиль)
Whisper large-v3 turboТот же набор, быстрееСвоё железо, дешевлеНизкаяОткрытая
Vosk (alpha cephei)Хороший, офлайнRaspberry Pi, локальноНизкаяОткрытая (Apache-2.0)
Yandex SpeechKitОдин из лучших под РФОблако ЯндексаНизкаяПлатный API, 180 мин бесплатно
SaluteSpeech (Сбер)ХорошийОблако СбераНизкаяПлатный API

Выбор сводится к двум вопросам: нужен ли вам офлайн (берите Vosk или локальный Whisper) и важна ли максимальная точность именно на русской речи в шумной обстановке (тогда облачные SpeechKit/SaluteSpeech сильнее). По официальной документации, у Яндекса для распознавания речи первые 180 минут бесплатны, а синтез тарифицируется по символам (Yandex SpeechKit, pricing).

Какую языковую модель поставить в «мозг»?

LLM — единственный блок, где в 2026 году у вас максимальная свобода. Голосовой ассистент не требует какой-то «голосовой» модели: под капотом это обычный текстовый чат. Поэтому сюда ставится тот же агент, что вы собрали бы для текстовых ответов, плюс короткий системный промпт, адаптирующий стиль под устную речь.

Ключевые критерии при выборе LLM под голос:

  • Скорость первого токена (TTFT). В голосовом режиме человек ждёт ответа секунды, а не минуты. Чем быстрее модель отдаёт первый токен в стриминге, тем короче пауза. Лёгкие модели (вроде семейства fast/flash) здесь выигрывают у тяжёлых «рассуждающих».
  • Стоимость. Голосовой диалог генерирует много коротких ходов. Дорогая heavy-модель на каждый чих разорит; разумнее держать две — быструю для рутины и тяжёлую для сложных вопросов.
  • Качество русского. Модель должна понимать русскую речь без переключения на английский и без «китайского» мусора в ответе.
  • Удержание контекста. Голосовой диалог обычно короткий, но многокадровый: «поставь будильник», «а на 10 минут позже», «нет, на 8 утра». Модель обязана помнить предыдущий ход, иначе переспрос «а про тот второй?» уходит в пустоту. Важно явно ограничить глубину памяти: держать в контексте последние 3–5 реплик, а остальное отбрасывать — иначе токены раздуваются и растёт задержка.

Полезная тактика — разделить модели по ролям. Быстрый и дешёвый агент-классификатор определяет интент («таймер», «погода», «сложный вопрос», «переключить на оператора»), а тяжёлая LLM включается только для сложных случаев. Это и снижает среднюю задержку, и экономит бюджет: 90% бытовых команд не требуют глубокой «рассуждающей» модели.

Именно этот блок удобнее всего собирать на готовой платформе: вы создаёте агента с нужным промптом и базой знаний, подключаете навыки и инструменты, а наружу отдаёте текстовый ответ, который потом озвучит TTS. На AgentHere такой агент-«мозг» собирается без кода — это и есть тот самый LLM-блок из нашей схемы. Подробно про устройство таких агентов — в статье что такое ИИ-агенты и в гайде как создать AI-ассистента за 5 минут.

Как выбрать синтез речи (TTS) с русским голосом?

TTS — последний блок, и именно его чаще всего слышит пользователь. Здесь русский язык — главный фильтр: англоязычные модели звучат на русском либо карикатурно, либо никак. По состоянию на август 2026 года для русского языка реально пригодны три группы решений.

Открытые модели. Лидер здесь — Silero TTS: полностью end-to-end, портативная, с библиотекой голосов и автоматической расстановкой ударений и омонимов для русского языка (snakers4/silero-models на GitHub). Для русского доступно 6 голосов, частоты 8 и 16 кГц (PyTorch Hub — Silero). По независимой оценке русскоязычных TTS 2024 года, методы на базе Fastspeech2 (Silero, Yandex, EdgeTTS) дают лучшую разборчивость речи, хотя чуть уступают по естественности интонации (alphacephei, 2024). Коммерческая лицензия обсуждается отдельно; community-версия распространяется по AGPL-3.0. Это хороший выбор, если вы держите всё на своём сервере.

Российские облачные API. Yandex SpeechKit и SaluteSpeech от Сбера — самые зрелые коммерческие варианты под русский язык, с естественными голосами и готовыми интеграциями. SaluteSpeech, например, позиционируется именно для голосовых IVR и обработки звонков (SaluteSpeech, IVR). Подробнее про озвучку текста разными нейросетями — в отдельном гайде по озвучке текста нейросетью.

Гибридные/edge решения. Для лёгких задач хватает и бесплатного Microsoft Edge TTS — он неплохо справляется с русским и работает из Python без ключей, хотя официально за пределами РФ доступ ограничен.

При выборе TTS важно отличать обычный синтез от клонирования голоса. Обычный TTS использует фиксированный набор готовых голосов от поставщика — это безопасно и юридически чисто. Клонирование же обучает новую модель под конкретный голос по короткой sample-записи и поднимает уже отдельный вопрос согласия (см. ниже). Для большинства голосовых ассистентов достаточно набора стандартных голосов Silero, SpeechKit или SaluteSpeech — клонирование нужно только если вы хотите фирменный голос бренда или конкретного диктора.

TTSКачество русскогоМодель работыКому подходит
SileroХорошее, 6 голосовСвой сервер, бесплатно (AGPL)Локальные и open-source проекты
Yandex SpeechKitОчень хорошееОблако, платноПродакшен под РФ
SaluteSpeechОчень хорошееОблако, платноГолосовые боты и IVR
Edge TTSПриемлемоеБесплатно, без ключаПрототипы и демо

Что такое wake-word и как снизить задержку ответа?

Два самых частых технических провала голосового помощника — ложное срабатывание на фоновый шум и длинная пауза перед ответом. Они решаются отдельными инструментами.

Слово-активации (wake-word). Чтобы ассистент не слушал постоянно и не слал весь поток в облако, перед ASR ставят лёгкий локальный детектор, который «просыпается» только на заданную фразу. Готовые решения: openWakeWord — полностью открытая библиотека с предобученными моделями, работает на 100% офлайн (dscripka/openWakeWord на GitHub). Альтернатива — Porcupine от Picovoice: заявляет точность выше 97%, загрузку CPU ниже 3,5% на Raspberry Pi и тоже работает офлайн; есть бесплатный tier для разработки и коммерческая лицензия для продакшена (Picovoice — Porcupine Wake Word). Wake-word-стадия почти не добавляет задержки, зато радикально экономит трафик и приватность.

Задержка (latency). Чтобы диалог ощущался как «живой», система должна начать отвечать примерно за 200–500 мс после того, как пользователь закончил фразу (Switchboard — Voice AI Latency). Основной виновщик паузы — не ASR и не TTS, а первый токен LLM. Поэтому ключевые приёмы ускорения:

  • Стриминг на каждом этапе. ASR отдаёт текст частями, LLM стримит токены, TTS озвучивает первыми же кусками, не дожидаясь конца ответа.
  • Быстрая LLM для рутины. Тяжёлую модель включают только когда быстрый агент сам решит, что вопрос сложный.
  • Короткие ответы. Чем короче реплика LLM, тем меньше звука синтезирует TTS и тем быстрее она зазвучит.

Цель по задержке для голосового ассистента — ответ начинаться в пределах 500 мс. Если пауза больше секунды, пользователь думает, что ассистент «завис», и переспрашивает.

Энд-ту-энд голосовые модели (speech-to-speech, без текстового моста) теоретически снижают задержку ещё сильнее, и соответствующие подходы активно исследуются в академических работах по low-latency голосовым ассистентам (arXiv:2508.04721). Но в продакшене в 2026 году каскад «ASR → LLM → TTS» остаётся стандартом — он прозрачнее, дешевле и каждый блок заменяется независимо.

Как собрать голосового помощника: 7 шагов

Самый частый вопрос — с чего начать, если не хочется писать низкоуровневый код целиком. Рабочий сценарий 2026 года — собрать «мозг» на платформе агентов, а ASR и TTS подключить как внешние сервисы.

  1. Определите сценарий. Голосовые помощники делятся на две категории: домашний ассистент (команды умному дому, таймеры, музыка) и голосовой бот для бизнеса (приём звонков, запись, ответы по базе). От сценария зависит всё остальное — один бот = один сценарий.
  2. Соберите базу знаний. Прайс, расписание, FAQ, политика возврата, список команд умного дома. Чем точнее база, тем меньше галлюцинаций у LLM.
  3. Создайте агента-«мозг» на AgentHere. Описываете системным промптом роль и жёстко задаёте голосовой формат: короткие предложения, без списков и таблиц, числа прописью. Этому агенту прикладываете базу знаний и нужные инструменты. Этот шаг не требует кода — он описан в гайде как создать AI-ассистента за 5 минут.
  4. Подключите распознавание речи. Для прототипа на русском — Yandex SpeechKit или SaluteSpeech (быстрый старт, готовое API). Для офлайн-ассистента на Raspberry Pi — локальный Whisper turbo или Vosk. ASR отдаёт распознанный текст вашему агенту.
  5. Подключите синтез речи. Выбираете TTS под бюджет: Silero — бесплатно на своём сервере, SpeechKit/SaluteSpeech — за естественность и стабильность в продакшене. TTS принимает текстовый ответ агента и возвращает аудио.
  6. Настройте слово-активации и стриминг. Ставите openWakeWord или Porcupine спереди, включаете стриминг на ASR, LLM и TTS. Без этого пауза перед ответом убьёт ощущение диалога.
  7. Тестируйте на реальных записях. Берёте 20–30 реальных фраз или звонков, прогоняете через ассистента, размечаете, где он не расслышал, соврал или ответил слишком длинно. Иначе в продакшен поедет бот, который раздражает пользователей.

Не поручайте голосовому ассистенту приём платежей и работу с персональными данными без человеческого контроля. Платежи, паспортные и медицинские данные — это всегда переключение на оператора.

Готовые шаблоны агентов под поддержку и ответы по базе знаний есть в галерее маркетплейса, а работать с агентом удобнее из десктопного приложения.

Законно ли клонировать чужой голос и что с приватностью

Самая скользкая часть темы — клонирование голоса. Современные TTS умеют за минуту обучиться на десятке секунд чужой речи и синтезировать её неразличимо от оригинала. Это удобно для бренд-войса ассистента, но сразу поднимает юридические вопросы.

В России голос относится к биометрическим персональным данным — а на их обработку, и тем более публичное использование и клонирование, требуется письменное согласие человека. Публично распространять чужой голос (как и изображение) без отдельного явного согласия прямо запрещено действующими поправками о распространении персональных данных. Отдельного «закона о дипфейках» пока нет, но ответственность наступает по уже действующим нормам о персональных данных и защите граждан от недостоверной информации. Практический вывод для разработчика голосового помощника:

  • Свой голос или лицензированный — безопасно. Используйте собственную запись, голос штатного диктора по договору или готовый голос из коммерческого TTS.
  • Чужой голос без согласия — незаконно, даже если «просто для теста». Особенно если результат публикуется или используется в продукте.
  • Записи разговоров с пользователями — тоже персональные данные. Если ассистент их хранит или анализирует, нужна политика обработки и право на удаление.

Если ассистент обрабатывает звонки клиентов, юридическая упаковка (договор, политика, согласие на запись) — не дополнительная опция, а часть релиза. Без неё первый же инцидент станет вашим.

Часто задаваемые вопросы

Сколько стоит собрать голосового помощника?

Зависит от подхода. Полностью открытый стек (локальный Whisper + Silero + openWakeWord + агент на бесплатном тарифе) ничего не стоит, но требует сервера и базовых навыков. Коммерческий вариант (SpeechKit/SaluteSpeech для ASR и TTS + платный тариф агента) — это оплата по символам для синтеза и по минутам для распознавания, плюс подписка на агента; точные тарифы ASR/TTS смотрите на странице цен SpeechKit и в тарифах AgentHere.

Можно ли обойтись без программирования?

Частично да. «Мозг» (агента с промптом и базой знаний) собирают без кода на AgentHere. Но обвязка — микрофон, стриминг аудио, wake-word, подключение ASR/TTS по API — обычно требует хотя бы базового скрипта на Python. Полностью no-code решений под произвольного голосового ассистента пока немного: готовые платформы (SaluteBot, Just AI) дают визуальный редактор сценариев, но привязывают к себе внутри своей экосистемы.

Какая latency считается нормальной для голосового ассистента?

Около 200–500 мс до начала ответа — тогда диалог ощущается живым (Switchboard). Выше секунды — пользователь начинает думать, что ассистент завис. Главный рычаг снижения — стриминг на всех трёх этапах и быстрая LLM с низким временем первого токена.

Какой язык программирования выбрать для сборки?

Python — самый разумный выбор: под него есть готовые библиотеки для всех блоков (whisper, silero, vosk, vosk-api, openwakeword), клиентские SDK к SpeechKit и SaluteSpeech, и удобная работа со стримингом аудио. Для веб-фронтенда ассистента подойдёт JavaScript/Web Audio API.

Можно ли сделать голосового ассистента офлайн?

Да. Локальный Whisper (или turbo-версия) для ASR, Silero для TTS и openWakeWord для активации — все работают без интернета. Это единственный вариант для приватного домашнего ассистента или для сценариев с чувствительными данными, которые нельзя отправлять в облако. Цена — нужен свой GPU или хотя бы мощный CPU.

Итог

Собрать голосового помощника на ИИ в 2026 году — значит собрать три отдельных модуля: распознавание речи (Whisper / SpeechKit / Vosk), языковую модель-«мозг» и синтез речи с русским голосом (Silero / SpeechKit / SaluteSpeech). Главные ловушки — задержка ответа (держите её ниже 500 мс через стриминг) и клонирование чужого голоса без согласия (запрещено). Сам «мозг» удобнее всего собирать без кода на готовой платформе агентов, а ASR и TTS подключать как внешние сервисы.

Чтобы не строить логику с нуля, начните с шаблона агента на AgentHere или загляните в маркетплейс — там есть готовые агенты под поддержку и ответы по базе знаний. Регистрация бесплатная, а первый голосовой прототип на записях звонков можно собрать за один вечер. Если хотите сразу в продакшен — зарегистрируйтесь и соберите первого агента прямо сейчас.

Источники

#голосовой помощник #распознавание речи #TTS #speech-to-text #AI-агент

Похожие статьи

Как создать голосового помощника на ИИ в 2026 году | AgentHere