Text to Speech API: интеграция озвучки — Спикми

Text to Speech API: интеграция озвучки в приложение

Как подключить Text to Speech API к приложению или боту: сравнение Google TTS, Fish Audio и других движков, цены, лимиты и примеры кода. Озвучить текст можно в Спикми.

Что такое Text to Speech API и зачем он нужен разработчику?

TTS API принимает текст и возвращает аудио — MP3, WAV или OGG — в одном HTTP-запросе. Разработчику не нужно разбираться в синтезе речи: это слой абстракции, за которым стоит нейросетевая модель провайдера.

Старые TTS-движки склеивали заранее записанные куски речи — на стыках слышны были «швы» и роботизированный ритм. Современные модели обучены на миллионах часов живой речи и генерируют паттерны интонации целиком, включая паузы и смех. Разница слышна с первой фразы.

Типичные сценарии:

  • голосовые реплики Telegram-бота или ассистента

  • приветствие в IVR / автоответчике

  • озвучка карточек товаров и рекламных роликов

  • нейровитубер или персонаж для стрима в реальном времени

  • обучающие материалы с озвучкой на иностранном языке

Ключевой параметр для интерактивных сценариев — задержка до первого чанка аудио. Порог восприятия: менее 500 мс. Если ответ приходит дольше — диалог ощущается как «мёртвый».

Попробовать Speakmi

Google Text to Speech API vs Fish Audio API vs другие: что выбрать для русского языка?

Google Cloud TTS — зрелый сервис с поддержкой 40+ языков и WaveNet-моделями. Хорошо работает в экосистеме GCP. Для русского — приемлемо, но не лидер по естественности интонации. Тарификация — по символам, с автосписанием при превышении бесплатного лимита; страница квот обновлена 14 июля 2026 г., конкретные цифры бесплатного лимита Google оговаривает право менять.

Fish Audio — по оценке рейтинга Novita AI (май 2026), лучший API для клонирования голоса среди мультиязычных провайдеров. Клон строится из образца длиной 30 секунд, без дообучения модели (zero-shot). Именно на движке Fish Audio работает Speakmi (Спикми).

Fish Audio — товарный знак его правообладателя. Мы не являемся его представителем или партнёром; используем API Fish Audio как поставщика технологии синтеза речи.

ElevenLabs — лидер по качеству голоса в независимых тестах. Multilingual v3 работает с русским без акцента. Минус — цена: стандартная модель стоит $200 за 1 млн символов, Turbo-версия вдвое дешевле ($100 за 1 млн символов), но у Turbo есть фоновый белый шум. Задержка Turbo v2.5 — около 300 мс до первого чанка.

Yandex SpeechKit v3 — сильный вариант для русского, работает по gRPC, аутентификация через IAM-токен. Оценивает весь текст перед синтезом, что даёт стабильные ударения.

Таблица сравнения (данные на сентябрь 2026):

ДвижокКачество русскогоЦена за 1 млн символовБесплатный лимитLatency (первый чанк)Клонирование голоса
Google Cloud TTSХорошееНесколько уровней, зависит от типа голосаЕсть, точный лимит уточнять на странице pricing~200–400 мсНет
Fish Audio / SpeakmiОтличноеЗависит от пакетаПервые 30 секунд бесплатно (Speakmi)~300–400 мсДа, 30 сек образец
ElevenLabs StandardОтличное~$200Ограниченный free tier~400 мсДа, 30 мин датасет
ElevenLabs Turbo v2.5Хорошее~$100То же~300 мсДа
Yandex SpeechKit v3Отличное (русский)По символам, тарифы на yandex.cloudЕсть~200–350 мсНет
GenVoiceХорошееВ рублях, см. genvoice.ruЕсть~300 мсНет

Для русского языка в коммерческих проектах — SpeechKit или Fish Audio. Для мультиязычного продукта с клонированием — Fish Audio или ElevenLabs (если бюджет позволяет).

Google Text to Speech API vs Fish Audio API vs другие: что выбрать для русского языка? — инфографика Speakmi

Как подключить Text to Speech API: пошаговая интеграция на примере Speakmi

Speakmi не раскрывает публичный API как готовую функцию — он в разработке. Пример ниже показывает универсальную логику подключения любого TTS API с OpenAI-совместимым эндпоинтом (AITUNNEL, Zowy, GenVoice и другие реализуют тот же паттерн).

1. Получить API-ключ

Зарегистрируйся на сайте провайдера, перейди в раздел API / Developer, создай ключ. Храни его в переменной окружения, не в коде.

2. Сформировать запрос

Стандартный OpenAI-совместимый эндпоинт:

POST https://<provider>/v1/audio/speech
Authorization: Bearer <API_KEY>
Content-Type: application/json

{
  "model": "tts-1",
  "input": "Привет, это тестовая озвучка.",
  "voice": "alloy",
  "response_format": "mp3"
}

Для AITUNNEL достаточно сменить base_url — структура запроса идентична OpenAI.

3. Обработать аудио-ответ

Ответ — бинарный поток. В Python:

import requests, os

response = requests.post(
    "https://api.aitunnel.ru/v1/audio/speech",
    headers={"Authorization": f"Bearer {os.environ['API_KEY']}"},
    json={"model": "tts-1", "input": "Текст для озвучки", "voice": "alloy"}
)
with open("output.mp3", "wb") as f:
    f.write(response.content)

Если провайдер возвращает сырой PCM (например, Zowy — WAV 24 kHz mono), конвертируй через FFmpeg:

ffmpeg -i input.wav -codec:a libmp3lame output.mp3

4. Встроить в приложение или бота

Для Telegram-бота на Aiogram — отправь файл методом send_audio или send_voice. Установи лимит на длину входного текста (разумный потолок — 20 000 символов за один запрос, иначе модель сама бьёт текст на чанки и на стыках могут появляться артефакты).

5. Задеплоить

Для MVP — Railway: деплой прямо из GitHub-репозитория по кнопке, без настройки инфраструктуры. Для продакшна с нагрузкой — Hetzner или AWS.

Как подключить Text to Speech API: пошаговая интеграция на примере Speakmi — инфографика Speakmi

Сколько стоит Text to Speech API: как считать токены и не переплатить?

Как тарифицирует API — Технический мужской

Большинство TTS API тарифицирует по числу символов (или токенов), отправленных на синтез. Логика простая: чем длиннее текст — тем больше списывается.

Как считать бюджет:

  • Одна минута русской речи ≈ 800–1000 символов.

  • 1000 минут контента ≈ 800 000–1 000 000 символов.

  • ElevenLabs Standard: 1 млн символов = $200 → минута ≈ $0,20.

  • ElevenLabs Turbo: 1 млн символов = $100 → минута ≈ $0,10.

  • Speakmi: стоимость минуты — около 10–13 ₽, цена видна до нажатия «Озвучить».

Токены у Speakmi не сгорают: купил пакет — списывается только то, что реально озвучил, хоть сегодня, хоть через полгода.

Три правила, чтобы не переплатить:

  1. Обрезай пробелы и лишние переносы до отправки — они тоже считаются символами.

  2. Кешируй результат: если один и тот же текст озвучивается повторно — отдавай сохранённый файл, не делай новый запрос.

  3. Используй Turbo/Flash-модели для черновиков — они дешевле, для финального варианта переключись на стандартную.

Отдельный риск: у Google Cloud TTS биллинг включается автоматически при превышении лимита. Если не выставлен алерт на бюджет — счёт может прийти неожиданно. Настрой Monitoring API usage сразу после подключения.

Сколько стоит Text to Speech API: как считать токены и не переплатить? — инфографика Speakmi

Text to Speech Pro: чем платные тарифы отличаются от бесплатных?

Коротко: бесплатный уровень — для тестирования, платный — для продакшна.

ПараметрБесплатныйПлатный (Pro)
Лимит символов/месяцОграничен (у каждого провайдера свой порог)Высокий или неограниченный
Клонирование голосаОбычно недоступноДоступно
Качество моделиБазоваяУлучшенная / нейросетевая
Поддержка эмоцийНетДа (у части провайдеров)
Автодокупка при исчерпанииНетЕсть (ElevenLabs Creator+)
Перенос неиспользованных токеновНетДа (ElevenLabs при активной подписке)
SLA / приоритет в очередиНетДа

Важный нюанс по ElevenLabs: на тарифе Creator и выше доступна автоматическая докупка токенов при исчерпании лимита — сервис не останавливается посреди месяца. Неиспользованные токены переносятся на следующий месяц, если подписка активна.

Для Professional Voice Cloning в ElevenLabs нужен датасет 30 минут записей. Для zero-shot клонирования в Fish Audio достаточно 30 секунд — это принципиальная разница, если нужен быстрый прототип.

Speakmi: первые 30 секунд озвучки бесплатно — можно оценить качество голоса до оплаты. Попробовать на speakmi.ru.

Какие форматы вывода поддерживает TTS API: MP3, WAV, OGG — что выбрать?

Какой формат выбрать — Молодой мужской

MP3 — универсальный выбор для большинства задач: маленький размер, воспроизводится везде. WAV — без потерь, нужен, если дальше будешь обрабатывать аудио в редакторе. OGG/Opus — оптимален для Telegram (бот возвращает голосовые сообщения именно в этом формате).

Zowy отдаёт WAV 24 kHz mono или сырой PCM — для Telegram нужна конвертация через FFmpeg. Большинство других провайдеров поддерживают MP3 напрямую.

Правило: если конечный пункт — Telegram-бот, проверь, принимает ли метод send_voice твой формат. Для send_audio подходит MP3. Для send_voice — OGG/Opus.

Попробовать Speakmi

Как встроить TTS API в Telegram-бота или веб-приложение без бэкенда?

Telegram-бот — самый быстрый путь до пользователя. Бот удобнее веб-приложения на телефоне: не нужно открывать браузер, авторизовываться, нажимать лишние кнопки.

Минимальная архитектура бота с озвучкой (Python + Aiogram):

  1. Пользователь отправляет текст или Markdown-файл.

  2. Бот передаёт текст на TTS API.

  3. Получает MP3 в ответе.

  4. Отправляет аудио пользователю через send_audio.

Лимит обрабатываемого текста за один запрос — 20 000 символов. Длиннее — дели на части вручную, иначе модель сама нарежет текст на чанки и на стыках появятся артефакты. Их можно вырезать в аудиоредакторе, но проще не допускать.

Деплой без бэкенда в классическом смысле — Railway: подключаешь GitHub-репозиторий, нажимаешь Deploy. Для MVP этого достаточно.

Веб-приложение без бэкенда (serverless):

  • Используй Cloudflare Workers или Vercel Edge Functions — они выполняют запрос к TTS API на сервере, ключ не попадает в браузер.

  • Не вызывай TTS API напрямую из браузерного JS — API-ключ окажется в открытом виде в коде.

Готовый Telegram-бот на базе Gemini 2.5 Flash TTS через Langchain, задеплоенный на Railway, — рабочая схема, которую реализуют за один вечер. Gemini TTS поддерживает 30+ голосов и лимит контекста 32 000 токенов за запрос.


Как встроить TTS API в Telegram-бота или веб-приложение без бэкенда? — инфографика Speakmi

Частые вопросы

Можно ли использовать Google Text to Speech API бесплатно и какой лимит?
Да, бесплатный уровень есть. Точные цифры лимита Google оговаривает право менять — смотри актуальные данные на cloud.google.com/text-to-speech/pricing (страница обновлена 14 июля 2026 г.). При превышении лимита биллинг включается автоматически, поэтому сразу настрой алерт на бюджет в Google Cloud Monitoring — иначе счёт придёт неожиданно.
Какой TTS API лучше всего работает с русским языком в 2026 году?
Для чистого русского — Yandex SpeechKit v3: модель оценивает весь текст целиком перед синтезом, ударения стабильнее. Для мультиязычного продукта с клонированием голоса — Fish Audio (30 секунд образца, zero-shot). ElevenLabs Multilingual v3 тоже работает с русским без акцента, но стоит $200 за 1 млн символов против вдвое более дешёвого Turbo. Источник: рейтинг Novita AI, май 2026; тест avatarbox.ru, май 2026.
Как получить API-ключ для озвучки текста и сколько это стоит?
Регистрируешься на сайте провайдера → раздел API / Developer → создаёшь ключ. Это бесплатно. Деньги списываются за использование: ElevenLabs Turbo — ~$100 за 1 млн символов, Yandex SpeechKit — по символам на yandex.cloud, Speakmi — около 10–13 ₽ за минуту. Большинство провайдеров дают бесплатный лимит для тестирования.
Чем Fish Audio API отличается от Google Cloud TTS по качеству голоса?
Fish Audio специализируется на клонировании голоса: 30 секунд образца — и готовый клон без дообучения модели. Google Cloud TTS сильнее в масштабируемости и интеграции с GCP-экосистемой, поддерживает 40+ языков. По естественности русской речи Fish Audio субъективно выигрывает; по инфраструктурной зрелости и корпоративной поддержке — Google. Источник: рейтинг Novita AI, май 2026.
Как интегрировать Text to Speech в Telegram-бота на Python?
Используй Aiogram как фреймворк для бота. Логика: получить текст от пользователя → POST-запрос к TTS API с текстом в теле → получить MP3 в ответе → отправить через bot.send_audio(). Если провайдер возвращает WAV или PCM — конвертируй через FFmpeg перед отправкой. Лимит на один запрос — 20 000 символов. Для деплоя MVP — Railway (подключение GitHub-репозитория по кнопке).
Что такое Text to Speech Pro и стоит ли платить за расширенный тариф?
Pro-тариф открывает клонирование голоса, улучшенные нейросетевые модели, автодокупку токенов при исчерпании лимита и перенос остатка на следующий месяц. Для тестирования идеи хватает бесплатного уровня. Для продакшна (бот с реальными пользователями, регулярная озвучка контента) — Pro оправдан: базовые модели дают заметно более роботизированный результат, а остановка сервиса из-за исчерпания лимита обходится дороже абонентской платы.
Как не превысить лимит токенов при массовой озвучке через API?
Три конкретных шага: 1) Кешируй результат — одинаковый текст озвучивай один раз, отдавай сохранённый файл повторным запросам. 2) Обрезай лишние пробелы и переносы строк до отправки — они тоже считаются символами. 3) Для черновиков и тестов используй Turbo/Flash-модели (в 2 раза дешевле стандартных), финальную версию озвучивай на основной. У Google Cloud TTS дополнительно настрой бюджетный алерт в Monitoring API usage — автосписание включается без предупреждения.