Отправь в бота голосовое на 20-30 секунд. Через минуту твой голос читает любой текст.
Это называется клонирование голоса: сервис слушает короткую запись и учится говорить так же. Дальше любой текст звучит так, будто ты сам его наговорил. Не нужен микрофон, тишина и десять дублей — записал голосовое как обычно и получил голос, которым можно озвучить сценарий, пост или главу книги.
Хватает 10-30 секунд записиНе надо начитывать час текста, как в других сервисах
Прямо в Telegram, из голосового сообщенияНе нужен компьютер и возня с файлами
Голос сохраняется в «Моих голосах»Один узнаваемый голос во всей серии роликов
Только свой голос, с подтверждениемНикто не сделает копию твоего голоса без твоего согласия
Символы читаются словами, а не по знакам
«149₽» звучит как «сто сорок девять рублей», а не «сто сорок девять эр».
Цены, проценты и номера в тексте написаны знаками, а вслух так не говорят. Перед озвучкой мы разворачиваем их в произносимую форму — в прайсах, рекламных текстах и голосовом меню это заметно сразу.
Один и тот же текст: «Скидка 50% на пакет №3 — всего 149₽»
Без вычитки
Знаки читаются как попало
С вычиткой текста
«пятьдесят процентов… номер три… сто сорок девять рублей»
Рубли, проценты, номера«₽», «%» и «№» произносятся словами
Слышно на прайсах и рекламеТам знаков больше всего — и ошибка режет слух
Ничего не надо настраиватьВычитка идёт сама, до озвучки
Скажи, как читать — прямо в тексте
Шёпот на интриге, пауза перед фактом, смех в конце шутки.
В большинстве сервисов эмоция — это ползунок на весь текст: либо всё радостно, либо всё грустно. Нам нужнее точность: в одной фразе шёпот, в следующей — обычная подача. Поэтому подсказка пишется прямо в тексте, в квадратных скобках, там, где нужна.
Я знаю, кто это сделал. [шёпотом] Только не говори никому.
[пауза] Это был... сосед. [смеётся]
Сама подсказка вслух не читается — она только меняет подачу.
Послушать, как это звучит
Подсказка в нужном месте текстаНе «весь ролик радостно», а точная подача по фразам
Паузы и дыханиеРечь не звучит как непрерывный поток
Темп от 0,5 до 2 разУкладка в хронометраж 15, 30 или 60 секунд
Кнопки эмоций в ботеС телефона — без ручного набора подсказок
В браузере и в Telegram — без разницы
Голоса, токены и история общие. Начал в боте с телефона — продолжил в браузере за компьютером.
Бот — не урезанная версия «на попробовать». В нём есть всё то же: озвучка, копия своего голоса из голосового сообщения, выбор голоса, эмоции кнопками, оплата. Сделал копию голоса в боте — она появилась на сайте. Купил пакет на сайте — токены сразу доступны в боте.
Копия голоса из голосового сообщенияВ боте это одно действие, файлы загружать не надо
Результат приходит голосовымМожно сразу переслать в свой канал
Видно, сколько осталось ждатьА не просто «идёт обработка» без конца
Оплата не выходя из ботаБез переходов на сайт и обратно
Голос под задачу — послушай и выбери
Спокойный женский для аудиокниги, дикторский для рекламы, бархатный мужской для чтения книг и историй.
Озвучка текста нейросетью — это превращение написанного текста в звучащую речь: программа читает текст голосом, близким к человеческому, и отдаёт готовый аудиофайл. Раньше для этого нанимали диктора и писали студию, сейчас достаточно вставить текст в поле. В Спикми (Speakmi) это поле есть в браузере и в Telegram-боте.
Как это работает
Вставь текст. Сценарий ролика, пост, главу книги — до 30 000 символов за раз. Резать на части не нужно.
Выбери голос. Из каталога или свой, если уже сделал копию своего голоса. Прямо в тексте можно поставить подсказку для подачи.
Скачай готовый файл. MP3 для монтажа, WAV для телефонии, голосовое сообщение для Telegram.
Сколько будет стоить — видно до нажатия кнопки. Списывается только после того, как файл готов. Все озвучки остаются в истории: можно вернуться и скачать заново.
Чтобы начать, нужен только email. Карту привязывать не надо, подписки нет.
Чем ИИ-озвучка отличается от синтезатора речи
Разница слышна в первые три секунды. Старые синтезаторы склеивали речь из
заранее записанных кусочков, поэтому интонация была ровной и одинаковой в любой
фразе — по такому голосу сразу понятно, что читает машина. Нейросеть не
склеивает, а порождает звук целиком: она учитывает, где в предложении вопрос,
где перечисление, а где конец мысли, и ставит паузы там, где их поставил бы
человек.
Практическое следствие: ИИ-озвучку можно ставить в ролик или подкаст без
извинений перед слушателем. Синтезатор годился для навигатора и объявлений на
вокзале, где от голоса требуется разборчивость, а не живость.
Второе отличие — управляемость. Нейросети можно сказать, как читать: подсказка
прямо в тексте меняет подачу отдельной фразы, а не всей озвучки целиком. И
третье: ИИ-голос можно создать заново по образцу — записать 10–30 секунд
своей речи и получить голос, который прочитает любой текст. Синтезатору для
этого нужна была студийная сессия на несколько часов.
Почему русский текст дороже английского
Мы считаем стоимость по объёму текста в байтах, а не по длине готового аудио — за паузы и тишину платить не нужно. Здесь есть особенность, о которой лучше знать заранее: кириллица в кодировке UTF-8 занимает 2 байта на символ против 1 байта у латиницы. Поэтому русский текст той же длины обходится дороже английского.
Мы говорим об этом прямо, а не оставляем обнаружить в счёте.
Что можно озвучить
Видео и Reels — закадровый голос без микрофона и без своего голоса в кадре.
Подкасты — ровное чтение без «эээ» и без переписывания дублей.
Обучающие курсы и презентации — длинный текст одним голосом, без склеек между занятиями.
Реклама — с правами на коммерческое использование и документами для бухгалтерии.
Голосовое меню для телефона — приветствие и подсказки для клиентов, которые звонят в компанию.
Видишь цену до того, как нажал
«18 секунд озвучки — 12 токенов». Видно до нажатия кнопки, а не после списания.
Ролик на десять минут у диктора — это тысячи рублей и день-два ожидания. У нас та же десятка минут выходит примерно в 70 ₽ и готова сразу. Правка одной фразы после согласования — бесплатно, в пределах пакета.
Токены не сгорают — купил и пользуешься когда угодно, срока жизни нет
Без подписки — разовый платёж, автосписаний нет
История построчно — видно, за что списано
Перегенерация бесплатна — правка не стоит нового заказа
Пакеты, а не подписка
Купил — пользуешься когда угодно. Токены не сгорают, автосписаний нет.
Первые 30 секунд — бесплатно, без карты. Оплата картой РФ и через СБП. Для юрлиц — счёт и закрывающие документы.
Не хватило — докупаешь, остаток суммируется. Ничего не теряется.
Для рекламы и бизнеса — с документами
Коммерческие права включены с первого платного пакета. Чек приходит сам, счёт — по запросу.
Озвучку можно ставить в платную рекламу, на YouTube, в подкасты и клиентские проекты — без доплат и отчислений. Чек по 54-ФЗ приходит на email автоматически. Юрлицам и ИП выставляем счёт и присылаем закрывающие документы.
Публиковать в платной рекламеПрава с первого пакета 149 ₽, без доплат и отчислений
Провести расходЧек по 54-ФЗ на email, счёт и акт для юрлица
Голос сотрудника или амбассадораКлонирование с его подтверждением, записи хранятся в РФ
Форматы под задачуMP3 для видео, WAV для телефонии, голосовое для Telegram
Твой голос — только твой
Клонировать можно свой голос и только с подтверждением. Удалил — исчез и у нас, и у провайдера.
Голос — биометрия, и мы относимся к нему соответственно. При клонировании ты подтверждаешь, что это твой голос или что у тебя есть на него права. Записи хранятся на российских серверах.
Только свой голосС подтверждением прав, образцы проходят модерацию
Приватно по умолчаниюМодель не попадает в публичный каталог и недоступна другим
Хранение в РоссииЗаписи и файлы на российской инфраструктуре, по 152-ФЗ
Удаление — полноеСнимаем модель у провайдера и стираем файлы, а не прячем из интерфейса
Тексты генераций не логируемВ журналах нет того, что ты озвучивал
Стоимость зависит от длины текста. Пакеты токенов начинаются от 149 рублей, в пересчёте это примерно 10-13 рублей за минуту готового аудио. Точная сумма показывается в редакторе до нажатия кнопки, списание происходит после того, как файл готов.
Можно попробовать бесплатно?
Да, первые 30 секунд озвучки бесплатны и не требуют привязки карты. Нужен только email для входа. Этого хватает, чтобы послушать несколько голосов на своём тексте и решить, подходит ли качество.
Сгорают ли токены, если я ими не пользуюсь?
Нет. Купленные токены остаются на балансе без срока годности. Это осознанное отличие: у части сервисов на рынке неиспользованный баланс аннулируется через несколько месяцев, и об этом написано мелким шрифтом в оферте.
В каком формате скачивается озвучка?
MP3 — он открывается везде и сразу ложится на монтажную дорожку. Все готовые озвучки остаются в истории, поэтому файл можно скачать заново, если он потерялся.
Нужен ли VPN и можно ли оплатить российской картой?
VPN не нужен, сервис работает напрямую. Оплата проходит российской картой через ЮKassa, после оплаты приходит чек.
Правильно ли нейросеть читает русские слова и ударения?
В большинстве случаев да. Но есть слова-близнецы, которые пишутся одинаково, а читаются по-разному: «замок» и «замок» — здесь модель иногда ошибается, потому что выбирает по смыслу фразы. Если слово важное, замените его синонимом или перестройте фразу, а результат послушайте до скачивания. Знаки «₽», «%» и «№» разворачиваются в слова автоматически.
Можно использовать озвучку в коммерческих проектах?
Да, права на использование готового аудио передаются с первого же оплаченного пакета, включая рекламу и монетизируемые видео. Для бизнеса выдаём чек, а по запросу — счёт и закрывающие документы.
Чем это отличается от бесплатных читалок текста?
Бесплатные читалки дают синтетический голос, по которому сразу слышно машину. Здесь голоса звучат с человеческой интонацией, можно задать эмоцию и клонировать собственный голос — это то, за что платят.
Послушай свой голос — это бесплатно
30 секунд бесплатно, без карты, вход по email. Вставь текст в браузере или отправь голосовое в бота.