Константин ВасинБлог
Контент и тексты

Озвучка текста нейросетью: локальные модели и клон своего голоса

Синтез речи перестал быть роботизированным, и за него больше не обязательно платить помесячно. Показываю два пути — облачный и локальный — и объясняю, когда какой выбирать.

Коротко
  • Два пути: облачный сервис — качество с первого дубля за подписку; локальная модель — безлимит и приватность бесплатно.
  • Клон голоса делается по образцу в 10–30 секунд и копирует не только тембр, но и манеру.
  • Синтез выдаёт не тембр, а пунктуация: модель читает по знакам препинания, поэтому текст надо переписывать под речь.
  • Озвучка — редкий случай, когда домашнее железо реально тянет задачу, в отличие от текстовых моделей.
Содержание статьи
  1. Два пути: облако и локально
  2. Когда какой вариант
  3. Где синтез слышно, а где нет
  4. Клон своего голоса: что учесть
  5. Что дальше

Синтез речи — та область, где за последние пару лет изменилось всё. Раньше выбор стоял между роботом из навигатора и живым диктором за деньги. Сейчас голос генерируется по образцу в десять секунд, а модель можно поставить прямо на компьютер.

Два пути: облако и локально

Облачные сервисы. Лучшее качество, стабильные интонации, поддержка русского. Платите помесячно — порядка двадцати долларов за тариф, которого хватает на регулярный контент. Я держу такую подписку, потому что для роликов важна предсказуемость: результат должен быть с первого дубля.

Локальная модель. Ставится на компьютер, работает без интернета и без ограничений. Я тестировал модель Qwen3-TTS на 1,7 миллиарда параметров: на Windows нужна видеокарта от 8 ГБ, на Mac с M-чипом работает и так. Одна дорожка генерируется за 30–60 секунд.

Как это выглядит на практике

Даёте модели образец голоса на 10–30 секунд — и дальше генерируете этим голосом безлимитно: без токенов, без подписки, без отправки чего-либо в интернет, с поддержкой русского и других языков. Получается заметно лучше, чем я ожидал от модели такого размера.

Локальная озвучка — редкий случай, когда домашнее железо действительно тянет задачу. С текстовыми моделями всё сильно хуже: там разрыв с облаком огромный, я разбирал это отдельно в статье про локальные нейросети.

Облако или своя машина
Облачный сервис
  • лучшее качество и стабильные интонации
  • результат обычно с первого дубля
  • ~20 $ в месяц, лимиты по символам
  • текст уходит на чужие серверы
Локальная модель
  • бесплатно и без лимитов, работает без интернета
  • на Mac с M-чипом — без отдельной видеокарты, 30–60 с на дорожку
  • качество ниже на длинных и эмоциональных кусках
  • ничего не покидает ваш компьютер
Дальше по теме

Показываю примеры и настройки

В канале выкладываю живые примеры озвучки и разбираю, что слышно на слух, а что нет.

Когда какой вариант

Задача Что выбрать
Ролики каждый день, важен первый дубль облачный сервис
Много черновых версий, эксперименты локальная модель
Приватный текст, который нельзя отправлять локальная модель
Нужны эмоции и сложные интонации облачный сервис
Разовая задача раз в месяц локальная модель

Где синтез слышно, а где нет

Короткие ролики под музыку — не слышно почти никогда. Длинный монолог — слышно: у синтеза слишком ровный темп и набор повторяющихся интонационных ходов. Человек ускоряется, сбивается, меняет громкость; модель — почти нет.

Что выдаёт синтез сильнее всего

Не тембр, а пунктуация. Модель читает по знакам препинания: где стоит запятая — там пауза. Текст, написанный «для глаз», звучит неестественно. Помогает переписать его под речь — короткими фразами, с точками вместо запятых, — и прогнать через редактуру по инфостилю. После этого разница с живой начиткой резко сокращается.

Клон своего голоса: что учесть

Образец должен быть чистым: без музыки, эха и посторонних звуков. Десяти секунд достаточно, тридцати — лучше. Записывайте в том же темпе и настроении, в каком потом будет звучать текст: модель копирует манеру, а не только тембр.

И отдельно про этику: клонировать чужой голос без разрешения нельзя — это не только некрасиво, но и юридически проблемно. Свой — сколько угодно.

Как начать за вечер

  1. Определитесь, что вам важнее: качество с первого дубля или отсутствие подписки.
  2. Запишите чистый образец голоса на 10–30 секунд.
  3. Прогоните один и тот же текст через облачный сервис и локальную модель — сравните на слух.
  4. Перепишите текст под речь: короткие фразы, точки вместо запятых.
  5. Решайте по результату, а не по обзорам: разница между сервисами на русском языке больше, чем в англоязычных тестах.
Читайте такжеЛокальные нейросетиПро локальные нейросети снимают ролики с обещанием «заменил все подписки». Я потратил на них неделю и специально взял ноутбук помощнее. Рассказываю, что вышло на самом деле и для каких задач локальная модель всё-таки нужна.

Что дальше

Озвучка — один кирпич в контентном конвейере. Рядом стоят расшифровка (обратная задача — аудио в текст) и написание самого текста, о котором я писал в разборе статей нейросетью.

Собранные вместе, они дают простую вещь: вы надиктовываете мысль голосом, получаете текст, правите его и возвращаете обратно в звук — уже в чистом виде и своим голосом.

Что забрать из статьи
  1. Образец голоса записывайте чистым и в той же манере, в какой потом должен звучать текст.
  2. Короткие фразы и точки вместо запятых убирают половину «роботизированности».
  3. Ролики каждый день — облако; эксперименты, черновики и приватные тексты — локально.
  4. Чужой голос без разрешения не клонируйте: это и некрасиво, и юридически проблемно.
  5. Сравнивайте сервисы на своём русском тексте: разница здесь больше, чем в англоязычных тестах.
Забрать материал

Гайд «6 проектов в Claude Code»

Карусели, Reels, клон-голос, авто-монтаж, второй мозг — с промптами и командами. Бесплатно, отдаёт бот в Telegram.

Частые вопросы

Можно ли озвучить текст своим голосом?

Да. Современным моделям хватает образца в 10–30 секунд вашей речи, после чего они генерируют этим голосом любой текст. Качество на коротких фразах уже почти неотличимо от записи, на длинных монологах слышны интонационные повторы.

Нужна ли мощная видеокарта?

Для локальной генерации на Windows нужна видеокарта от 8 ГБ. На Mac с M-чипом работает без отдельной видеокарты: одна дорожка генерируется примерно за 30–60 секунд.

Чем локальная озвучка лучше облачной?

Отсутствием подписки и лимитов: сгенерировать можно сколько угодно, ничего не уходит в интернет. Облачные сервисы дают лучшее качество и стабильнее интонации, но платить нужно каждый месяц.

Сколько стоит облачная озвучка?

Порядка двадцати долларов в месяц за тариф, которого хватает на регулярный контент. Это оправдано, если озвучка идёт в публикацию каждый день, и не оправдано, если вы делаете ролик раз в месяц.

Слышно ли, что текст озвучен нейросетью?

На коротких роликах — почти нет, особенно под музыку. На длинном тексте слышно: у синтеза ровный темп и повторяющиеся интонационные ходы, живой человек так не говорит. Это лечится нарезкой на короткие фразы и правкой пунктуации.

Константин Васин
Предприниматель, маркетолог

10 лет в маркетинге и онлайн-образовании. Запускаю проекты в одиночку на Claude Code и показываю экономику как есть. Все методы из блога сначала обкатываю на своих проектах и только потом описываю.