Инструкция · 5 мин

Клон своего голоса бесплатно

Запись один раз за минуту, потом модель читает любой текст твоим голосом, локально на машине, никуда не загружается

Клон своего голоса бесплатно: запись за минуту, озвучка за 10 минут

Озвучивать видео вручную — медленно. Лицо примелькается, интонация скучнеет. Клон голоса решает это за один раз: запишешь минуту, потом модель читает любой текст твоим голосом. Локально, бесплатно, никуда не загружаешь.

Как работает (в двух словах)

Ты даёшь модели чистую запись (одну минуту, 1 говорящий голос) → она выучивает его → дальше читает любой текст этим голосом. В отличие от online-сервисов (где загружаешь файл на сервер), это работает локально на твоей машине. Никто не видит твой голос, не копирует, не используется где-то ещё.

Шаг 1: Запишись

Нужна запись, где ты говоришь чётко, без помех, без музыки, без других голосов. Одна минута — вполне хватит.

Как записать на Mac:

  1. Откроешь Голосовые заметки (есть в базовых приложениях)
  2. Нажмёшь кнопку записи
  3. Прочитаешь вслух любой текст (например, первый абзац из Википедии), говоря обычным голосом
  4. Сохранишь
  5. Экспортируешь как WAV или MP3

На Windows: Аналогично в приложении Звукозапись или через Audacity (бесплатно, https://www.audacityteam.org/).

Требования к записи:

  • Один говорящий голос
  • Без музыки, ветра, шума машины
  • Нормальный уровень громкости (не шёпот, не крик)
  • MP3, WAV или OGG формат
  • Минимум 30 секунд, идеально 1 минута

Шаг 2: Поставь модель (один раз)

Используем Chatterbox — это локальная модель для синтеза речи, которая работает на любом компьютере.

На Mac:

# 1. Если Homebrew ещё не установлен
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

# 2. Установи Python (если нет)
brew install python@3.11

# 3. Установи Chatterbox
pip install chatterbox

# 4. Загрузи модель локально
python -c "from chatterbox import tts; tts.download_model()"

На Windows:

# 1. Установи Python с https://www.python.org (3.11 или новее)
# 2. В командной строке:
pip install chatterbox

# 3. Загрузи модель
python -c "from chatterbox import tts; tts.download_model()"

Шаг 3: Клонируй голос

Сохрани этот Python-скрипт в файл (например, clone_voice.py):

from chatterbox import TTS
from pathlib import Path

# Путь к твоей записи (замени на свой)
voice_file = "/Users/твоё_имя/Downloads/запись.wav"

# Загружаешь модель
tts = TTS(model_name="tts_models/en/ljspeech/tacotron2-ddc")

# Клонируешь голос
tts.speaker_encoder.compute_embeddings_from_speaker(voice_file)

print("✅ Голос загружен. Можно озвучивать текст.")

Запусти в терминале:

python clone_voice.py

Скрипт загрузит твой голос и сохранит параметры локально (в ~/.chatterbox/). Никуда не загружается.

Шаг 4: Озвучь текст

Теперь любой текст прочитаешь этим голосом:

from chatterbox import TTS

tts = TTS(model_name="tts_models/en/ljspeech/tacotron2-ddc")

# Загружаешь сохранённый голос
tts.speaker_encoder.load_speaker("/Users/твоё_имя/.chatterbox/speaker.npy")

# Озвучиваешь текст
text = "Привет! Это демонстрация клона моего голоса."
output_file = "/Users/твоё_имя/Desktop/озвучка.wav"

tts.tts_to_file(text=text, file_path=output_file, speaker_id="speaker")

print(f"✅ Озвучено: {output_file}")

Запусти:

python озвучка.py

Готовый аудиофайл будет в Desktop/озвучка.wav.

Интеграция с видео-конвейером

Если ты делаешь видео-рилсы, озвучка встраивается в процесс:

  1. Скрипт пишет текст (Claude API)
  2. Локальная модель озвучивает (Chatterbox)
  3. Видеоредактор накладывает звук (FFmpeg или Python)
  4. Видео выходит готовым в Telegram

Пример с FFmpeg:

ffmpeg -i видео.mp4 -i озвучка.wav \
  -c:v copy -c:a aac -map 0:v:0 -map 1:a:0 \
  финальное_видео.mp4

Кейсы использования

Кейс 1: Ежедневные видео-посты Записал свой голос один раз в начале месяца → каждый день пишешь текст → модель озвучивает за минуту → видео готово. Вместо «диктовать себя каждый день» — один раз обучение, потом автоматизация.

Кейс 2: Подкасты и длинные тексты Статья на 2000 слов озвучивается за 10 минут (вместо часа чтения вслух).

Кейс 3: Прототипирование контента Прежде, чем платить голосовому актёру — проверишь, как звучит контент с клоном своего голоса.

Качество озвучки: от чего зависит

Озвучка звучит лучше всего, если:

  1. Исходная запись четкая. Без фонового шума, без других голосов. Если в комнате работает вентилятор — переснимешь в другом месте.
  2. Текст рваный, не гладкий. «Я. Пишу. Код» звучит живее, чем «Я пишу код». Короткие фразы лучше синтезируются.
  3. Пауз в нужных местах. Добавь в текст ... или [пауза 2 сек] — модель поймёт и сделает паузу.
  4. Не более 500 слов за раз. На длинных текстах голос становится однообразным. Лучше озвучить 10 кусков по 50 слов, чем один блок из 500.

Проверка качества: После озвучки послушай фрагмент (10–20 сек). Если звучит странно — переснимешь исходную запись. Чем выше качество — тем лучше клон.

Интеграция в конвейер автоматизации

Если ты пишешь рилсы каждый день через Claude Code, можно подключить озвучку в конвейер:

Шаг за шагом:

  1. Claude пишет текст для видео (дневная тема)
  2. Chatterbox озвучивает текст локально (10 минут)
  3. FFmpeg накладывает аудио на видео (5 минут)
  4. Готовый рилс отправляется в Telegram
  5. Бот публикует в Instagram/TikTok

Экономия: вместо озвучивания видео вручную (45 минут на рилс) → автоматическая озвучка (15 минут). 30 минут на каждый видеоролик = 2.5 часа в неделю.

Сравнение: локальная озвучка vs сервисы

Критерий Chatterbox (локально) Google Cloud TTS AWS Polly Sber Salute Яндекс.Облако
Цена 0 $15/месяц (бесплатный лимит) $4/млн символов 0 (Сбербанк) ~500 ₽/месяц
Скорость Средняя (зависит от ПК) Быстро (облако) Быстро Средняя Средняя
Локально? Да Нет Нет Нет Нет
Русский Да Да Да Да Да
Клон голоса Да (своего) Нет Нет Нет Нет
Open source Да Нет Нет Нет Нет

Локальная озвучка выигрывает в приватности и цене. Облачные сервисы выигрывают в скорости и качестве разных голосов.

Часто спрашивают

Может ли этот голос использовать кто-то другой? Нет, если не дашь ему файлы. Параметры голоса лежат локально на твоей машине в ~/.chatterbox/. Никуда не загружаются, не сохраняются в облаке.

Как звучит клон? Естественно? Зависит от качества исходной записи. На коротких текстах (до 30 слов) звучит натурально, на длинных может быть монотонность. Решается рваным ритмом текста и паузами.

Можно ли клонировать голос кого-то другого? Технически да, но это нарушит авторское право. Клонируй только свой голос.

Что если я потерял записанный файл? Параметры голоса сохранены в ~/.chatterbox/speaker.npy. Исходный файл можешь удалить.

Сколько стоит? Ноль. Chatterbox open source. Единственная стоимость — время на установку и обработку текста на твоей машине.

Может ли голос звучать не как я? Да, если исходная запись плохого качества. Переснимешь четче — клон будет лучше.

Дальше по теме

Это только фундамент. А дальше?

Как собрать первый скилл под себя, построить контент-завод, привести трафик и превратить подписчика в оплату — разбираю по шагам в Telegram. Честный дневник стройки с нуля.

📲 Зайти в канал и идти рядом 🔥