Клон своего голоса бесплатно
Запись один раз за минуту, потом модель читает любой текст твоим голосом, локально на машине, никуда не загружается
Клон своего голоса бесплатно: запись за минуту, озвучка за 10 минут
Озвучивать видео вручную — медленно. Лицо примелькается, интонация скучнеет. Клон голоса решает это за один раз: запишешь минуту, потом модель читает любой текст твоим голосом. Локально, бесплатно, никуда не загружаешь.
Как работает (в двух словах)
Ты даёшь модели чистую запись (одну минуту, 1 говорящий голос) → она выучивает его → дальше читает любой текст этим голосом. В отличие от online-сервисов (где загружаешь файл на сервер), это работает локально на твоей машине. Никто не видит твой голос, не копирует, не используется где-то ещё.
Шаг 1: Запишись
Нужна запись, где ты говоришь чётко, без помех, без музыки, без других голосов. Одна минута — вполне хватит.
Как записать на Mac:
- Откроешь Голосовые заметки (есть в базовых приложениях)
- Нажмёшь кнопку записи
- Прочитаешь вслух любой текст (например, первый абзац из Википедии), говоря обычным голосом
- Сохранишь
- Экспортируешь как WAV или MP3
На Windows: Аналогично в приложении Звукозапись или через Audacity (бесплатно, https://www.audacityteam.org/).
Требования к записи:
- Один говорящий голос
- Без музыки, ветра, шума машины
- Нормальный уровень громкости (не шёпот, не крик)
- MP3, WAV или OGG формат
- Минимум 30 секунд, идеально 1 минута
Шаг 2: Поставь модель (один раз)
Используем Chatterbox — это локальная модель для синтеза речи, которая работает на любом компьютере.
На Mac:
# 1. Если Homebrew ещё не установлен
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"
# 2. Установи Python (если нет)
brew install python@3.11
# 3. Установи Chatterbox
pip install chatterbox
# 4. Загрузи модель локально
python -c "from chatterbox import tts; tts.download_model()"
На Windows:
# 1. Установи Python с https://www.python.org (3.11 или новее)
# 2. В командной строке:
pip install chatterbox
# 3. Загрузи модель
python -c "from chatterbox import tts; tts.download_model()"
Шаг 3: Клонируй голос
Сохрани этот Python-скрипт в файл (например, clone_voice.py):
from chatterbox import TTS
from pathlib import Path
# Путь к твоей записи (замени на свой)
voice_file = "/Users/твоё_имя/Downloads/запись.wav"
# Загружаешь модель
tts = TTS(model_name="tts_models/en/ljspeech/tacotron2-ddc")
# Клонируешь голос
tts.speaker_encoder.compute_embeddings_from_speaker(voice_file)
print("✅ Голос загружен. Можно озвучивать текст.")
Запусти в терминале:
python clone_voice.py
Скрипт загрузит твой голос и сохранит параметры локально (в ~/.chatterbox/). Никуда не загружается.
Шаг 4: Озвучь текст
Теперь любой текст прочитаешь этим голосом:
from chatterbox import TTS
tts = TTS(model_name="tts_models/en/ljspeech/tacotron2-ddc")
# Загружаешь сохранённый голос
tts.speaker_encoder.load_speaker("/Users/твоё_имя/.chatterbox/speaker.npy")
# Озвучиваешь текст
text = "Привет! Это демонстрация клона моего голоса."
output_file = "/Users/твоё_имя/Desktop/озвучка.wav"
tts.tts_to_file(text=text, file_path=output_file, speaker_id="speaker")
print(f"✅ Озвучено: {output_file}")
Запусти:
python озвучка.py
Готовый аудиофайл будет в Desktop/озвучка.wav.
Интеграция с видео-конвейером
Если ты делаешь видео-рилсы, озвучка встраивается в процесс:
- Скрипт пишет текст (Claude API)
- Локальная модель озвучивает (Chatterbox)
- Видеоредактор накладывает звук (FFmpeg или Python)
- Видео выходит готовым в Telegram
Пример с FFmpeg:
ffmpeg -i видео.mp4 -i озвучка.wav \
-c:v copy -c:a aac -map 0:v:0 -map 1:a:0 \
финальное_видео.mp4
Кейсы использования
Кейс 1: Ежедневные видео-посты Записал свой голос один раз в начале месяца → каждый день пишешь текст → модель озвучивает за минуту → видео готово. Вместо «диктовать себя каждый день» — один раз обучение, потом автоматизация.
Кейс 2: Подкасты и длинные тексты Статья на 2000 слов озвучивается за 10 минут (вместо часа чтения вслух).
Кейс 3: Прототипирование контента Прежде, чем платить голосовому актёру — проверишь, как звучит контент с клоном своего голоса.
Качество озвучки: от чего зависит
Озвучка звучит лучше всего, если:
- Исходная запись четкая. Без фонового шума, без других голосов. Если в комнате работает вентилятор — переснимешь в другом месте.
- Текст рваный, не гладкий. «Я. Пишу. Код» звучит живее, чем «Я пишу код». Короткие фразы лучше синтезируются.
- Пауз в нужных местах. Добавь в текст
...или[пауза 2 сек]— модель поймёт и сделает паузу. - Не более 500 слов за раз. На длинных текстах голос становится однообразным. Лучше озвучить 10 кусков по 50 слов, чем один блок из 500.
Проверка качества: После озвучки послушай фрагмент (10–20 сек). Если звучит странно — переснимешь исходную запись. Чем выше качество — тем лучше клон.
Интеграция в конвейер автоматизации
Если ты пишешь рилсы каждый день через Claude Code, можно подключить озвучку в конвейер:
Шаг за шагом:
- Claude пишет текст для видео (дневная тема)
- Chatterbox озвучивает текст локально (10 минут)
- FFmpeg накладывает аудио на видео (5 минут)
- Готовый рилс отправляется в Telegram
- Бот публикует в Instagram/TikTok
Экономия: вместо озвучивания видео вручную (45 минут на рилс) → автоматическая озвучка (15 минут). 30 минут на каждый видеоролик = 2.5 часа в неделю.
Сравнение: локальная озвучка vs сервисы
| Критерий | Chatterbox (локально) | Google Cloud TTS | AWS Polly | Sber Salute | Яндекс.Облако |
|---|---|---|---|---|---|
| Цена | 0 | $15/месяц (бесплатный лимит) | $4/млн символов | 0 (Сбербанк) | ~500 ₽/месяц |
| Скорость | Средняя (зависит от ПК) | Быстро (облако) | Быстро | Средняя | Средняя |
| Локально? | Да | Нет | Нет | Нет | Нет |
| Русский | Да | Да | Да | Да | Да |
| Клон голоса | Да (своего) | Нет | Нет | Нет | Нет |
| Open source | Да | Нет | Нет | Нет | Нет |
Локальная озвучка выигрывает в приватности и цене. Облачные сервисы выигрывают в скорости и качестве разных голосов.
Часто спрашивают
Может ли этот голос использовать кто-то другой?
Нет, если не дашь ему файлы. Параметры голоса лежат локально на твоей машине в ~/.chatterbox/. Никуда не загружаются, не сохраняются в облаке.
Как звучит клон? Естественно? Зависит от качества исходной записи. На коротких текстах (до 30 слов) звучит натурально, на длинных может быть монотонность. Решается рваным ритмом текста и паузами.
Можно ли клонировать голос кого-то другого? Технически да, но это нарушит авторское право. Клонируй только свой голос.
Что если я потерял записанный файл?
Параметры голоса сохранены в ~/.chatterbox/speaker.npy. Исходный файл можешь удалить.
Сколько стоит? Ноль. Chatterbox open source. Единственная стоимость — время на установку и обработку текста на твоей машине.
Может ли голос звучать не как я? Да, если исходная запись плохого качества. Переснимешь четче — клон будет лучше.
Дальше по теме
- Конвейер рилсов без камеры — семь звеньев от темы к видео.
- Контент-завод в цифрах — расчёт на каруселях (то же про рилсы).
- Как подобрать тему для видео — что снимать, когда есть голос.
Это только фундамент. А дальше?
Как собрать первый скилл под себя, построить контент-завод, привести трафик и превратить подписчика в оплату — разбираю по шагам в Telegram. Честный дневник стройки с нуля.
📲 Зайти в канал и идти рядом 🔥