Как создать аудиокнигу своими руками: пошаговая инструкция

Как создать аудиокнигу своими руками: пошаговая инструкция

Пошаговая инструкция: как записать аудиокнигу своими руками — с микрофоном или через ИИ-озвучку без диктора. Форматы, инструменты, стоимость в 2026 году.

Попробовать Speakmi

Что нужно для создания аудиокниги: минимальный набор инструментов

Минимум для старта — текстовый файл и один из двух путей: микрофон + Audacity (бесплатный аудиоредактор) или ИИ-сервис вроде Speakmi (Спикми), где текст превращается в MP3 прямо в браузере. Студия и диктор — необязательны.

Путь 1 — запись голосом:

  • Микрофон: USB-микрофон для прямой записи в компьютер или бюджетная петличка Boya (её можно найти на Авито за 500–1000 ₽). Для качества выше среднего — портативный рекордер Zoom H1.

  • Редактор: Audacity (бесплатно) или АудиоМАСТЕР (совмещает рекордер и монтаж, есть скидки по промокодам). Adobe Audition — профессиональный вариант, но для начала избыточен.

  • Помещение: шкаф с одеждой поглощает эхо лучше, чем пустая комната. Если дома везде гулкие стены — салон незаведённого автомобиля работает как мини-студия.

Путь 2 — ИИ-озвучка:

  • Текстовый файл (TXT, DOCX).

  • Аккаунт в ИИ-сервисе: Speakmi, freets.ru, TTS Maker (у последнего бесплатный лимит 20 000 символов в неделю, коммерческие права включены).

  • Браузер. Всё.


Записать аудиокнигу самому или озвучить нейросетью: что выбрать?

Живой голос или ИИ — Глубокий женский

Живой голос даёт выразительность, которую ИИ пока не воспроизводит на 100%. ИИ даёт скорость и цену, которую живой диктор не перебьёт.

КритерийЗапись голосомИИ-озвучка
ОборудованиеМикрофон, тихая комнатаТолько браузер
Скорость1 час текста → 3–5 часов записи + монтаж29 000 символов → ~5 минут генерации
Стоимость0 ₽ (своё время) или 500–3000 ₽/час диктор-фрилансерОт 3 240 ₽ за книгу на 300 страниц (данные gptrf.ru, август 2026)
ПравкиПерезаписать кусокПоправить текст и перегенерировать
Разные персонажиНужно менять голос или звать второго диктораРазные голоса выбираются из каталога
Авторские права на голосПолностью твоиПрава зависят от сервиса; TTS Maker и ClipChamp дают коммерческие права бесплатно, ElevenLabs — только на платном тарифе

Если книга — художественная с несколькими персонажами и тебе важна живая интонация, запись своим голосом даст больше. Если нужно быстро и дёшево — ИИ закроет задачу за вечер.


Записать аудиокнигу самому или озвучить нейросетью: что выбрать? — инфографика Speakmi

Как подготовить текст книги к озвучке: разбивка, правка, форматирование

Почему озвучка звучит деревянно — Низкий мужской

Плохо подготовленный текст — главная причина, почему ИИ-озвучка звучит деревянно. Синтезатор читает всё буквально: сноски, номера страниц, тире без пробелов.

Шаги:

  1. Разбей на главы. Каждая глава — отдельный файл. Так удобнее навигировать при прослушивании и проще переозвучить одну главу, не трогая остальные. Оптимальный размер файла — до 30 000 символов.

  2. Убери лишнее. Сноски, номера страниц, колонтитулы, подписи к иллюстрациям, таблицы — всё это генерацияатор зачитает как текст. Удаляй.

  3. Замени тире и дефисы. Это главный скрытый баг: генераторы часто игнорируют дефис-разделитель, и фраза «он сказал — она ответила» звучит слитно, без паузы. Решение: в Word сделай автозамену «пробел + дефис» → «запятая». В одном тексте на 133 страницы такая замена закрыла 1 857 вхождений за секунды.

  4. Проверь имена и аббревиатуры. «ИИ» генерациитор может прочитать как «ии» или «два и». Расшифруй или напиши транскрипцию в скобках рядом.

  5. Расставь паузы. Абзац — естественная пауза. Для более долгой — поставь многоточие или пустую строку (поведение зависит от сервиса, проверяй на коротком тесте).

  6. Цветовая маркировка. Если глав много — окрашивай уже озвученные в Word в яркий цвет, чтобы не запутаться при пакетной обработке.


Как озвучить книгу через ИИ-сервис: пошаговый процесс

На примере Speakmi — сервис работает в браузере и в Telegram-боте, первые 30 секунд бесплатно, карта не нужна.

  1. Открой редактор. Веб-версия — speakmi.ru, Telegram-бот — t.me/speakmibot.

  2. Вставь текст первой главы. Оптимально — до 29 000–30 000 символов за одну генерацию.

  3. Выбери голос. Для художественных книг — голоса из категории «Повествование» (Narration). Для нон-фикшн — нейтральные дикторские голоса. Перед запуском проверяй звучание на одном коротком предложении: полная генерация большого файла занимает несколько минут, тест — секунды.

  4. Настрой эмоции, если нужно. Теги эмоций вставляются прямо в текст и меняют интонацию в конкретном месте — не нужно пересводить весь файл ради одной фразы.

  5. Запусти генерацию. 29 000 символов → примерно 34,5 минуты аудио, время генерации — около 5 минут.

  6. Прослушай и скачай. Формат — MP3. Если что-то звучит не так — правишь текст и перегенерируешь только нужный кусок.

  7. Повтори для каждой главы. Если сохранил голос в «Мои голоса» — просто вставляешь следующую главу, голос уже выбран.

Если публикуешь сериями — один раз сохраняешь голос в «Мои голоса» и дальше просто вставляешь новый текст на каждый выпуск, без повторной настройки.


Как озвучить книгу через ИИ-сервис: пошаговый процесс — инфографика Speakmi

Как смонтировать и оформить готовую аудиокнигу: главы, обложка, метаданные

После генерации или записи у тебя набор MP3-файлов по главам. Дальше — сборка.

  1. Объедини файлы по главам. Если записывал кусками — склей их в Audacity или АудиоМАСТЕРе. ИИ-генерация уже выдаёт один файл на главу.

  2. Добавь тишину между главами. 1–2 секунды тишины в конце каждого файла — стандарт. Без этого главы склеиваются в плеере ощутимо резко.

  3. Нормализуй громкость. В Audacity: Effects → Normalize → -1 dB. Так все главы будут звучать на одном уровне, даже если записывались в разное время.

  4. Пропиши эмоции ID3. Это метаданные внутри MP3: название книги, автор, номер главы, обложка. В Audacity — через File → Export → Edit Metadata. Без тегов плеер покажет «Неизвестный исполнитель».

  5. Сделай обложку. Размер — минимум 3000×3000 пикселей, JPG или PNG. Canva справится за 10 минут. Обложка нужна и для витрины платформы, и для тега ID3.

  6. Выбери финальный формат. MP3 — универсальный, подходит везде. M4B — формат аудиокниг с поддержкой закладок и глав (поддерживается Apple Books, некоторыми Android-плеерами). Если целевая аудитория — пользователи iPhone, делай M4B; для всего остального — MP3 достаточно.


Как смонтировать и оформить готовую аудиокнигу: главы, обложка, метаданные — инфографика Speakmi

Где и как распространять аудиокнигу: платформы и форматы

Готовую аудиокнигу можно выложить бесплатно или продавать — зависит от площадки и твоих прав на текст.

Яндекс Музыка. Принимает аудиокниги через дистрибьюторов (например, DistroKid, Amuse). Формат — MP3 320 kbps или FLAC. Охват — русскоязычная аудитория.

Storytel. Крупнейший стриминг аудиокниг в России. Принимают заявки от авторов напрямую через партнёрскую программу. Требования к качеству записи жёстче: фоновые шумы и артефакты ИИ-озвучки могут стать причиной отказа.

ЛитРес: Самиздат. Платформа для самостоятельной публикации. Принимают аудио от авторов, есть монетизация. Отдельный проект — «ЛитРес: Чтец»: можно озвучивать книги из каталога сервиса и получать вознаграждение.

Telegram-канал + Boosty. Самый быстрый путь без модерации. Загружаешь файлы на Яндекс Диск, даёшь ссылку подписчикам. Boosty позволяет закрыть часть контента за донат.

YouTube. Аудиокнига как видео со статичной обложкой — рабочий формат. Монетизация включается при наборе порога просмотров.


Сколько стоит создать аудиокнигу: сравнение вариантов

Сколько стоит создать аудиокнигу: сравнение вариантов — инфографика Speakmi

Попробовать Speakmi

ВариантСтоимостьВремя на книгу 200 стр.
Профессиональная студия + диктор3 000–8 000 ₽/мин готового аудиоНесколько недель
Фриланс-диктор500–1 500 ₽/мин1–2 недели
ИИ-сервис (Speakmi)Первые 30 секунд бесплатно, далее — токены1 вечер
Бесплатные ИИ-инструменты (TTS Maker, freets.ru)0 ₽, лимит 20 000 символов/неделю на TTS Maker1–3 вечера с учётом лимитов

Книга на 300 страниц через ИИ обходится от 3 240 ₽ (данные gptrf.ru, август 2026) — против десятков тысяч рублей за студийную запись. Разница в 10–30 раз, в зависимости от хронометража и диктора.

Первые 30 секунд озвучки в Speakmi бесплатно, карта не нужна — можно послушать свой текст реальным голосом, прежде чем решать, платить или нет.

Частые вопросы

Можно ли создать аудиокнигу без микрофона и студии?
Да. ИИ-сервисы вроде Speakmi или TTS Maker превращают текстовый файл в аудио прямо в браузере — без микрофона, без записи, без монтажа. TTS Maker даёт 20 000 символов в неделю бесплатно с коммерческими правами. Speakmi — первые 30 секунд бесплатно без карты. Качество ИИ-голоса достаточно для нон-фикшн и большинства художественных текстов.
Какой формат файла лучше для аудиокниги — MP3 или M4B?
MP3 работает везде: Telegram, Яндекс Музыка, Android, Windows. M4B поддерживает закладки и главы внутри одного файла — удобно на iPhone и в Apple Books. Если аудитория смешанная или ты не знаешь, где будут слушать, делай MP3. Если целишься в пользователей Apple — M4B.
Сколько времени занимает озвучка книги на 200 страниц?
Через ИИ: подготовка текста — 2–4 часа, генерация — 1–2 часа (с учётом проверки каждой главы). Итого — один вечер. 29 000 символов генерируются примерно за 5 минут и дают около 34,5 минут аудио. Запись собственным голосом: 1 час готового аудио требует 3–5 часов работы плюс монтаж.
Как разбить аудиокнигу на главы и добавить паузы между ними?
Каждую главу генерируй или записывай отдельным файлом — это упрощает правки и навигацию в плеере. В конце каждого файла добавляй 1–2 секунды тишины через Audacity (Generate → Silence). При сборке M4B можно прописать метки глав через mp4chaps или iTunes.
Можно ли продавать аудиокнигу, озвученную нейросетью?
Зависит от двух вещей: права на текст и права на голос. Текст — либо твой собственный, либо произведения, перешедшие в общественное достояние (в РФ — 70 лет после смерти автора). Права на голос: TTS Maker и ClipChamp дают коммерческие права на бесплатном тарифе, ElevenLabs — только на платном. Speakmi — уточняй в условиях сервиса перед коммерческой публикацией.
Какой голос выбрать для художественной книги, а какой — для нон-фикшн?
Для художественной — голоса из категории «Повествование» (Narration), с живой интонацией. В ElevenLabs для аудиокниг рекомендуется модель Multilingual v2. Для нон-фикшн — нейтральные дикторские голоса без выраженной эмоциональности. В любом случае: тестируй на одном коротком предложении перед запуском полной генерации.
Как загрузить готовую аудиокнигу на Яндекс Музыку или Storytel?
Яндекс Музыка принимает аудиокниги через дистрибьюторов — загружаешь файлы к ним, они передают на платформу. Storytel принимает заявки от авторов напрямую через партнёрскую программу на их сайте; требования к качеству записи строже, чем у дистрибьюторов. ЛитРес: Самиздат — самый простой путь для русскоязычного автора: прямая загрузка без посредников.
Можно ли использовать локальную модель для озвучки, чтобы не зависеть от сервиса?
Да, инструменты вроде OmniVoice позволяют запустить синтез локально: даёшь образец голоса — генерируешь сколько угодно без лимитов и без интернета. Минус — нужен мощный компьютер и время на настройку. Для разовой книги это избыточно; для регулярного производства или работы с большими объёмами — рабочий вариант.