Как создать аудиокнигу своими руками: пошаговая инструкция
Пошаговая инструкция: как записать аудиокнигу своими руками — с микрофоном или через ИИ-озвучку без диктора. Форматы, инструменты, стоимость в 2026 году.
Что нужно для создания аудиокниги: минимальный набор инструментов
Минимум для старта — текстовый файл и один из двух путей: микрофон + Audacity (бесплатный аудиоредактор) или ИИ-сервис вроде Speakmi (Спикми), где текст превращается в MP3 прямо в браузере. Студия и диктор — необязательны.
Путь 1 — запись голосом:
-
Микрофон: USB-микрофон для прямой записи в компьютер или бюджетная петличка Boya (её можно найти на Авито за 500–1000 ₽). Для качества выше среднего — портативный рекордер Zoom H1.
-
Редактор: Audacity (бесплатно) или АудиоМАСТЕР (совмещает рекордер и монтаж, есть скидки по промокодам). Adobe Audition — профессиональный вариант, но для начала избыточен.
-
Помещение: шкаф с одеждой поглощает эхо лучше, чем пустая комната. Если дома везде гулкие стены — салон незаведённого автомобиля работает как мини-студия.
Путь 2 — ИИ-озвучка:
-
Текстовый файл (TXT, DOCX).
-
Аккаунт в ИИ-сервисе: Speakmi, freets.ru, TTS Maker (у последнего бесплатный лимит 20 000 символов в неделю, коммерческие права включены).
-
Браузер. Всё.
Записать аудиокнигу самому или озвучить нейросетью: что выбрать?
Живой голос даёт выразительность, которую ИИ пока не воспроизводит на 100%. ИИ даёт скорость и цену, которую живой диктор не перебьёт.
| Критерий | Запись голосом | ИИ-озвучка |
|---|---|---|
| Оборудование | Микрофон, тихая комната | Только браузер |
| Скорость | 1 час текста → 3–5 часов записи + монтаж | 29 000 символов → ~5 минут генерации |
| Стоимость | 0 ₽ (своё время) или 500–3000 ₽/час диктор-фрилансер | От 3 240 ₽ за книгу на 300 страниц (данные gptrf.ru, август 2026) |
| Правки | Перезаписать кусок | Поправить текст и перегенерировать |
| Разные персонажи | Нужно менять голос или звать второго диктора | Разные голоса выбираются из каталога |
| Авторские права на голос | Полностью твои | Права зависят от сервиса; TTS Maker и ClipChamp дают коммерческие права бесплатно, ElevenLabs — только на платном тарифе |
Если книга — художественная с несколькими персонажами и тебе важна живая интонация, запись своим голосом даст больше. Если нужно быстро и дёшево — ИИ закроет задачу за вечер.

Как подготовить текст книги к озвучке: разбивка, правка, форматирование
Плохо подготовленный текст — главная причина, почему ИИ-озвучка звучит деревянно. Синтезатор читает всё буквально: сноски, номера страниц, тире без пробелов.
Шаги:
-
Разбей на главы. Каждая глава — отдельный файл. Так удобнее навигировать при прослушивании и проще переозвучить одну главу, не трогая остальные. Оптимальный размер файла — до 30 000 символов.
-
Убери лишнее. Сноски, номера страниц, колонтитулы, подписи к иллюстрациям, таблицы — всё это генерацияатор зачитает как текст. Удаляй.
-
Замени тире и дефисы. Это главный скрытый баг: генераторы часто игнорируют дефис-разделитель, и фраза «он сказал — она ответила» звучит слитно, без паузы. Решение: в Word сделай автозамену «пробел + дефис» → «запятая». В одном тексте на 133 страницы такая замена закрыла 1 857 вхождений за секунды.
-
Проверь имена и аббревиатуры. «ИИ» генерациитор может прочитать как «ии» или «два и». Расшифруй или напиши транскрипцию в скобках рядом.
-
Расставь паузы. Абзац — естественная пауза. Для более долгой — поставь многоточие или пустую строку (поведение зависит от сервиса, проверяй на коротком тесте).
-
Цветовая маркировка. Если глав много — окрашивай уже озвученные в Word в яркий цвет, чтобы не запутаться при пакетной обработке.
Как озвучить книгу через ИИ-сервис: пошаговый процесс
На примере Speakmi — сервис работает в браузере и в Telegram-боте, первые 30 секунд бесплатно, карта не нужна.
-
Открой редактор. Веб-версия — speakmi.ru, Telegram-бот — t.me/speakmibot.
-
Вставь текст первой главы. Оптимально — до 29 000–30 000 символов за одну генерацию.
-
Выбери голос. Для художественных книг — голоса из категории «Повествование» (Narration). Для нон-фикшн — нейтральные дикторские голоса. Перед запуском проверяй звучание на одном коротком предложении: полная генерация большого файла занимает несколько минут, тест — секунды.
-
Настрой эмоции, если нужно. Теги эмоций вставляются прямо в текст и меняют интонацию в конкретном месте — не нужно пересводить весь файл ради одной фразы.
-
Запусти генерацию. 29 000 символов → примерно 34,5 минуты аудио, время генерации — около 5 минут.
-
Прослушай и скачай. Формат — MP3. Если что-то звучит не так — правишь текст и перегенерируешь только нужный кусок.
-
Повтори для каждой главы. Если сохранил голос в «Мои голоса» — просто вставляешь следующую главу, голос уже выбран.
Если публикуешь сериями — один раз сохраняешь голос в «Мои голоса» и дальше просто вставляешь новый текст на каждый выпуск, без повторной настройки.

Как смонтировать и оформить готовую аудиокнигу: главы, обложка, метаданные
После генерации или записи у тебя набор MP3-файлов по главам. Дальше — сборка.
-
Объедини файлы по главам. Если записывал кусками — склей их в Audacity или АудиоМАСТЕРе. ИИ-генерация уже выдаёт один файл на главу.
-
Добавь тишину между главами. 1–2 секунды тишины в конце каждого файла — стандарт. Без этого главы склеиваются в плеере ощутимо резко.
-
Нормализуй громкость. В Audacity: Effects → Normalize → -1 dB. Так все главы будут звучать на одном уровне, даже если записывались в разное время.
-
Пропиши эмоции ID3. Это метаданные внутри MP3: название книги, автор, номер главы, обложка. В Audacity — через File → Export → Edit Metadata. Без тегов плеер покажет «Неизвестный исполнитель».
-
Сделай обложку. Размер — минимум 3000×3000 пикселей, JPG или PNG. Canva справится за 10 минут. Обложка нужна и для витрины платформы, и для тега ID3.
-
Выбери финальный формат. MP3 — универсальный, подходит везде. M4B — формат аудиокниг с поддержкой закладок и глав (поддерживается Apple Books, некоторыми Android-плеерами). Если целевая аудитория — пользователи iPhone, делай M4B; для всего остального — MP3 достаточно.

Где и как распространять аудиокнигу: платформы и форматы
Готовую аудиокнигу можно выложить бесплатно или продавать — зависит от площадки и твоих прав на текст.
Яндекс Музыка. Принимает аудиокниги через дистрибьюторов (например, DistroKid, Amuse). Формат — MP3 320 kbps или FLAC. Охват — русскоязычная аудитория.
Storytel. Крупнейший стриминг аудиокниг в России. Принимают заявки от авторов напрямую через партнёрскую программу. Требования к качеству записи жёстче: фоновые шумы и артефакты ИИ-озвучки могут стать причиной отказа.
ЛитРес: Самиздат. Платформа для самостоятельной публикации. Принимают аудио от авторов, есть монетизация. Отдельный проект — «ЛитРес: Чтец»: можно озвучивать книги из каталога сервиса и получать вознаграждение.
Telegram-канал + Boosty. Самый быстрый путь без модерации. Загружаешь файлы на Яндекс Диск, даёшь ссылку подписчикам. Boosty позволяет закрыть часть контента за донат.
YouTube. Аудиокнига как видео со статичной обложкой — рабочий формат. Монетизация включается при наборе порога просмотров.
Сколько стоит создать аудиокнигу: сравнение вариантов

| Вариант | Стоимость | Время на книгу 200 стр. |
|---|---|---|
| Профессиональная студия + диктор | 3 000–8 000 ₽/мин готового аудио | Несколько недель |
| Фриланс-диктор | 500–1 500 ₽/мин | 1–2 недели |
| ИИ-сервис (Speakmi) | Первые 30 секунд бесплатно, далее — токены | 1 вечер |
| Бесплатные ИИ-инструменты (TTS Maker, freets.ru) | 0 ₽, лимит 20 000 символов/неделю на TTS Maker | 1–3 вечера с учётом лимитов |
Книга на 300 страниц через ИИ обходится от 3 240 ₽ (данные gptrf.ru, август 2026) — против десятков тысяч рублей за студийную запись. Разница в 10–30 раз, в зависимости от хронометража и диктора.
Первые 30 секунд озвучки в Speakmi бесплатно, карта не нужна — можно послушать свой текст реальным голосом, прежде чем решать, платить или нет.
Частые вопросы
- Можно ли создать аудиокнигу без микрофона и студии?
- Да. ИИ-сервисы вроде Speakmi или TTS Maker превращают текстовый файл в аудио прямо в браузере — без микрофона, без записи, без монтажа. TTS Maker даёт 20 000 символов в неделю бесплатно с коммерческими правами. Speakmi — первые 30 секунд бесплатно без карты. Качество ИИ-голоса достаточно для нон-фикшн и большинства художественных текстов.
- Какой формат файла лучше для аудиокниги — MP3 или M4B?
- MP3 работает везде: Telegram, Яндекс Музыка, Android, Windows. M4B поддерживает закладки и главы внутри одного файла — удобно на iPhone и в Apple Books. Если аудитория смешанная или ты не знаешь, где будут слушать, делай MP3. Если целишься в пользователей Apple — M4B.
- Сколько времени занимает озвучка книги на 200 страниц?
- Через ИИ: подготовка текста — 2–4 часа, генерация — 1–2 часа (с учётом проверки каждой главы). Итого — один вечер. 29 000 символов генерируются примерно за 5 минут и дают около 34,5 минут аудио. Запись собственным голосом: 1 час готового аудио требует 3–5 часов работы плюс монтаж.
- Как разбить аудиокнигу на главы и добавить паузы между ними?
- Каждую главу генерируй или записывай отдельным файлом — это упрощает правки и навигацию в плеере. В конце каждого файла добавляй 1–2 секунды тишины через Audacity (Generate → Silence). При сборке M4B можно прописать метки глав через mp4chaps или iTunes.
- Можно ли продавать аудиокнигу, озвученную нейросетью?
- Зависит от двух вещей: права на текст и права на голос. Текст — либо твой собственный, либо произведения, перешедшие в общественное достояние (в РФ — 70 лет после смерти автора). Права на голос: TTS Maker и ClipChamp дают коммерческие права на бесплатном тарифе, ElevenLabs — только на платном. Speakmi — уточняй в условиях сервиса перед коммерческой публикацией.
- Какой голос выбрать для художественной книги, а какой — для нон-фикшн?
- Для художественной — голоса из категории «Повествование» (Narration), с живой интонацией. В ElevenLabs для аудиокниг рекомендуется модель Multilingual v2. Для нон-фикшн — нейтральные дикторские голоса без выраженной эмоциональности. В любом случае: тестируй на одном коротком предложении перед запуском полной генерации.
- Как загрузить готовую аудиокнигу на Яндекс Музыку или Storytel?
- Яндекс Музыка принимает аудиокниги через дистрибьюторов — загружаешь файлы к ним, они передают на платформу. Storytel принимает заявки от авторов напрямую через партнёрскую программу на их сайте; требования к качеству записи строже, чем у дистрибьюторов. ЛитРес: Самиздат — самый простой путь для русскоязычного автора: прямая загрузка без посредников.
- Можно ли использовать локальную модель для озвучки, чтобы не зависеть от сервиса?
- Да, инструменты вроде OmniVoice позволяют запустить синтез локально: даёшь образец голоса — генерируешь сколько угодно без лимитов и без интернета. Минус — нужен мощный компьютер и время на настройку. Для разовой книги это избыточно; для регулярного производства или работы с большими объёмами — рабочий вариант.

