Голосовой бот: что это, как работает и как создать — Спикми

Голосовой бот для Telegram: как сделать своего и какой выбрать готовый

Что такое голосовой бот, как он устроен и чем отличается от IVR. Как создать голосового бота для Telegram или бизнеса — пошаговый разбор с примерами. Разбор от Спикми.

Голосовой бот для Telegram: как сделать своего и какой выбрать готовый

Голосовой бот в Telegram принимает голосовые сообщения от клиента и отвечает голосом — записывает на приём, отвечает на вопросы, вносит данные в CRM. Это не старый IVR с кнопками «нажмите 1»: современный бот понимает свободную речь и реагирует уместно.

Ниже — как собрать такого бота на Python самому, какие готовые платформы для Telegram выбрать вместо этого и сколько это стоит в обоих случаях.

Что такое голосовой бот и чем он отличается от обычного чат-бота?

Чем отличается от чат-бота — Молодой мужской

Чат-бот принимает текст и отвечает текстом. Голосовой бот принимает голос и отвечает голосом. Это совершенно другая цепочка технологий и другой пользовательский опыт.

Главное отличие от IVR: IVR работает по жёсткому меню («скажите “да” или нажмите 1»), а голосовой бот понимает произвольную речь. Клиент говорит «хочу перенести запись на пятницу утром». Бот разбирает фразу, проверяет слоты в системе бронирования и подтверждает действие.

Ещё одна разница: голосовой бот работает в телефонии и мессенджерах (Telegram, WhatsApp), а не только на сайте.

Что такое голосовой бот и чем он отличается от обычного чат-бота? — инфографика Speakmi

Как работает голосовой бот: генерация речи, распознавание и сценарии

Внутри любого голосового бота работают три блока, соединённых в цепочку:

  1. ASR (распознавание речи) — переводит голос пользователя в текст. Популярные решения: Google Speech Recognition API (работает онлайн, быстрее и точнее для русского), Yandex SpeechKit, PocketSphinx (офлайн, но требует ~500 МБ ОЗУ и медленнее на русском).

  2. LLM / логика — обрабатывает текст, определяет намерение, формирует ответ. Здесь живут сценарии диалога, база знаний, интеграции с CRM и системами бронирования.

  3. TTS (генерация речи) — превращает текстовый ответ обратно в голос. Yandex SpeechKit назван одним из самых дорогих решений на российском рынке из-за монопольного положения. Альтернативы — ElevenLabs, Fish Audio*, решения на базе пакетов Windows. Терминология Speakmi (Спикми) строится вокруг понятий: голос (не voice/модель), клонирование голоса (не voice cloning), токены (не кредиты/баллы), генерация (не синтез/запрос), эмоции (не теги/SSML).

*Fish Audio — зарегистрированный товарный знак Fish Audio Inc. Сервис Speakmi не связан с Fish Audio, не является его официальным партнером или представителем.

Прототип можно собрать из этих трёх готовых блоков, не написав почти ни строки кода. Для этого берут готовые API вместо самостоятельной реализации.

Важный момент: каждый блок — отдельный компонент, часто отдельный сервис. Speakmi отвечает только за генерацию голоса на выходе (TTS). Распознавание речи и логику диалога обеспечивают другие инструменты.

Как работает голосовой бот: генерация речи, распознавание и сценарии — инфографика Speakmi

Готовые платформы для Telegram-бота: сравнение вместо самостоятельной сборки

Платформы для голосовых ботов делятся на четыре класса: готовые сервисы автообзвона, low-code-конструкторы диалоговых роботов, облачные контакт-центры и API-конструкторы для разработчиков.

ПлатформаТипЯзыкОриентировочная ценаИнтеграцииОграничения
TomoruГотовый сервис автообзвонаRUПо запросуCRM, телефонияНет no-code-конструктора
Alto AIДиалоговый конструкторRUПо запросуAmoCRM, Bitrix24Нужна настройка сценариев
Twin24Диалоговый конструкторRUПо запросуCRM, телефонияПо запросу
NaumenОблачный контакт-центрRUEnterpriseCRM, телефония, МИСВысокий порог входа
ZvonobotАвтообзвонRUОт 1 ₽/минБазовые интеграцииНет сложных диалогов
СПЕЙСТЕЛКонструктор ботовRUОт 390 ₽/мес*Телефония, CRMДата цены неизвестна
VoximplantAPI-конструкторRU/ENПо сценариюЛюбыеТребует разработки

*Цена СПЕЙСТЕЛ — без подтверждённой даты актуальности, уточняйте на сайте.

Для малого бизнеса с типовыми задачами (запись клиентов, FAQ, обзвон базы) подходят Zvonobot или Tomoru как старт без разработки. Для нестандартных сценариев выбирают Voximplant или сборку на открытых библиотеках.

Лимиты, которые стоит знать: один робот может вести до 200 диалогов одновременно с одного номера, до 10 одновременных линий обзвона на бота. Стоимость обслуживания робота — в среднем в 5–10 раз ниже месячного оклада одного живого сотрудника (данные из кейсов российских платформ, 2025).

Какой голосовой бот выбрать: сравнение популярных решений для бизнеса — инфографика Speakmi

Попробовать Speakmi

Для озвучки реплик бота — вместо стандартных голосов Windows или дорогого Yandex SpeechKit — можно сгенерировать нужный голос в Speakmi: первые 30 секунд бесплатно, стоимость минуты около 6–10 ₽.

Как создать голосового бота для Telegram: пошаговая инструкция

Telegram-бот, принимающий голосовые сообщения и отвечающий голосом, — реализуемо за одну неделю при базовых технических навыках.

Шаг 1. Выбери платформу или стек

Два пути:

  • No-code/low-code: платформа вроде Botmother, ManyChat (с голосовыми интеграциями) или специализированный конструктор.

  • Код: Python + speech_recognition (ASR через Google API) + pyttsx3 (TTS, работает офлайн) + Telegram Bot API.

Если выбираешь Python на Windows: перед pyttsx3 установи pywin32 и pypywin32, иначе пакет не запустится. pyaudio для записи с микрофона — устанавливай через готовый .whl-файл под свою версию Python (бинарники Кристоффа), иначе сборка падает с ошибкой.

Шаг 2. Настрой голос

Стандартно Windows даёт 3 голоса генерации речи, для русского — обычно только женский. Мужской голос добавляется пакетом Rachel Voice или внешним TTS-API.

Альтернатива — заранее озвучить все типовые реплики бота через TTS-сервис (например, Speakmi или через Telegram-бот) и отдавать готовые аудиофайлы. Это проще, чем держать TTS-движок в боте, и качество голоса выше.

Шаг 3. Напиши сценарий и базу знаний

Сценарий — на русском, без кода. Прописываешь: приветствие, список намерений (запись, отмена, вопрос о цене), ответы на каждый случай, fallback («не понял, уточните»).

Используй fuzzywuzzy для нечёткого поиска команд — бот распознает запрос, даже если клиент сформулировал его не дословно.

Важный приём: сначала воспроизведи приветствие, и только потом запускай прослушивание микрофона. Иначе бот записывает собственный голос и зацикливается. Метод adjust_for_ambient_noise (1 секунда) отсекает фоновый шум перед стартом.

Шаг 4. Подключи к Telegram

Регистрируй бота через @BotFather, получи токен, подключи Telegram Bot API. Заявки и уведомления можно дублировать в закрытую группу в Telegram или в ВКонтакте.

Шаг 5. Протестируй на реальных сценариях

Прогони типовые запросы вручную. Проверь: корректно ли бот идентифицирует клиента по номеру телефона (чтобы не дублировать карточки в CRM), правильно ли заносит данные, работает ли fallback.

Как создать голосового бота для Telegram: пошаговая инструкция — инфографика Speakmi

Сколько стоит создание голосового бота: самостоятельно vs готовые сервисы

ВариантЧто входитОриентировочная стоимость
Готовый сервис (Zvonobot, Tomoru)Платформа + сценарии + голосОт 5 000 ₽/мес и выше
Low-code-конструктор (Alto AI, Twin24)Настройка + интеграцииОт 10 000–30 000 ₽ setup + абонентка
Разработка под заказПолный цикл, любой сценарийОт 100 000 ₽ и выше
Самостоятельно на PythonВремя разработчика + API-расходыAPI Google Speech — бесплатно до лимита; Yandex SpeechKit — один из самых дорогих на рынке; генерация голоса — от 6–10 ₽/мин

Отдельная статья расходов — голос бота. Стандартные голоса TTS бесплатны, но звучат роботизированно. Качественная генерация через внешний API обходится дешевле, чем запись у диктора (500–3000 ₽/мин), и правится за секунды: изменил текст реплики — переозвучил сам.

Посекундная тарификация звонков у большинства платформ означает: если клиент сбросил на первой фразе, платишь только за 10 секунд, не за полную минуту.

Один практический совет по бюджету: ставь лимит на кампанию обзвона (например, 10 000 ₽), чтобы не слить весь баланс на большой базе случайно.

Сколько стоит создание голосового бота: самостоятельно vs готовые сервисы — инфографика Speakmi

Где голосовой бот реально помогает бизнесу: кейсы и сценарии

До 70% типовых обращений роботы закрывают самостоятельно без участия человека (данные российских платформ, 2025). Вот где это работает на практике:

Запись и отмена через YCLIENTS. Бот проверяет свободные слоты и мастеров в реальном времени, записывает клиента, переносит запись на другое время по голосовому запросу, отменяет все записи на день — без участия администратора. Записи от бота и от менеджера разделяются цветом (например, фиолетовый vs зелёный) для оценки эффективности.

Работа в нерабочее время. Ранним утром, поздним вечером, в праздники — бот принимает звонок, квалифицирует клиента, фиксирует заявку. Пропущенных обращений нет.

Реанимация зависших сделок. Если сделка в CRM (Bitrix24, AmoCRM) висит в одном статусе больше недели — бот сам перезванивает, уточняет ситуацию, обновляет статус.

Обзвон базы за один день. Несколько тысяч номеров из старой базы — за один день, с предложением нового оффера. Робот перезванивает в точно указанное клиентом время, не теряет тех, кто постоянно переносит разговор.

Медицинская запись через Medflex. Голосовой бот интегрируется с МИС Medflex для записи пациентов и проверки слотов врачей — тот же принцип, что с YCLIENTS.

Связка «робот + человек» работает лучше, чем только робот или только человек: бот берёт рутину (первичный контакт, квалификация, CRM), человек подключается на сложных сделках с высоким чеком и там, где важна эмпатия.

Где голосовой бот реально помогает бизнесу: кейсы и сценарии — инфографика Speakmi

Попробовать Speakmi

Как Speakmi помогает озвучить бота без разработчика за 5 минут

Роль Speakmi в боте — Технический мужской

Speakmi — это генерация и клонирование голоса, один из трёх блоков голосового бота: генерация реплик на выходе.

Что это даёт на практике:

  1. Открываешь speakmi.ru или Telegram-бот.

  2. Вставляешь текст реплики («Добрый день, вы позвонили в салон красоты…»).

  3. Выбираешь голос из библиотеки или загружаешь запись своего голоса для клонирования — бот будет говорить узнаваемо похожим на тебя голосом.

  4. Получаешь аудиофайл, вставляешь в сценарий бота.

Если реплика изменилась — переозвучиваешь одну фразу, не перезаписываешь весь сценарий. Стоимость минуты — около 6–10 ₽, первые 30 секунд бесплатно.

Важно: Speakmi отвечает только за генерацию голоса. Распознавание речи (ASR) и логику диалога обеспечивают отдельные инструменты — Google Speech Recognition, Yandex SpeechKit, LLM по выбору.

Клонирование голоса доступно только для своего голоса с подтверждением прав — клонировать чужие голоса без согласия нельзя.

Частые вопросы

Чем голосовой бот в Telegram отличается от чат-бота?
Чат-бот принимает текст и отвечает текстом. Голосовой бот работает со звуком: принимает голосовое сообщение, распознаёт речь и отвечает сгенерированным голосом. Это другая цепочка технологий — распознавание, обработка смысла и синтез, — и другой пользовательский опыт: клиенту не нужно ничего печатать.
Можно ли сделать голосового бота без разработчика?
Готовые конструкторы позволяют собрать сценарий без кода, а озвучка реплик вообще не требует разработки: текст вставляется в Speakmi, готовый файл подставляется в бота. Разработчик нужен там, где нужна нестандартная логика диалога или интеграция с внутренними системами компании — например, с CRM.
Сколько стоит собрать голосового бота?
Расходы делятся на платформу диалогов, распознавание речи и озвучку реплик. Первые две части зависят от объёма обращений, а голос считается по минутам готового аудио: около 10–13 рублей за минуту, причём первые 30 секунд бесплатны и не требуют привязки банковской карты. Точная сумма зависит от числа обращений в месяц.
Как бот получает голос — записывают диктора?
Нет, голос синтезируется нейросетью по введённому тексту, поэтому озвучить можно любую фразу мгновенно и без ограничений по словарю. Записи живого диктора при этом не используются вовсе — исключение только образец при клонировании, когда бот должен говорить голосом конкретного человека. Правка реплики при этом занимает секунды.
Можно ли использовать в боте клонированный голос?
Да, если это твой голос или голос сотрудника с его согласием. Образец на 10–30 секунд отправляется боту Speakmi в Telegram, дальше клон доступен для всех генераций на том же аккаунте. Клонировать чужой голос без разрешения нельзя — это нарушение правил сервиса.
Сколько времени занимает запуск голосового бота?
Сценарий и озвучка типовых реплик занимают день-два, дальше время уходит на подключение телефонии или мессенджера и тесты на реальных обращениях. Голосовая часть — самая быстрая: правка реплики занимает секунды и не требует новой записи, поэтому сценарий дорабатывают уже после запуска.
Легально ли использовать ИИ-голос в боте для бизнеса?
Да. Использование синтезированного голоса законно, коммерческие права на готовое аудио включены с первого платного пакета, для юрлиц выдаётся чек и по запросу закрывающие документы. Ограничение одно: клонировать можно свой голос или голос человека, давшего явное согласие на это. Записи при этом хранятся на серверах в России.