Все репозитории

Клонирование голоса по очень короткому образцу: минуты записи хватает, чтобы дообучить модель синтеза речи. Есть веб-интерфейс для разметки и обучения.

Кому подойдёт

Тем, кто хочет озвучивать тексты собственным или выбранным голосом.

Как начать

  1. Создай окружение: conda create -n GPTSoVits python=3.10 и conda activate GPTSoVits.
  2. Запусти установку: bash install.sh --device <CU126|CU128|ROCM|CPU> --source <HF|HF-Mirror|ModelScope> (для Mac — --device <MPS|CPU>).
  3. Дальше следуй README: подготовка данных, дообучение и запуск интерфейса.

Шаги взяты из README. Перед запуском сверься с актуальной версией в репозитории.

Звёзды за последние 30 дней

+1 1316 сент. — 5 окт.
61 22062 351

Описание автора

1 min voice data can also be used to train a good TTS model! (few shot voice cloning)

Классический веб-интерфейс для Stable Diffusion: генерация картинок из текста, доработка, апскейл и тысячи расширений от сообщества.

165 тыс.звёзд+664 за 30 дн.Python

Comfy-Org

ComfyUI

Растёт быстрее всех

Графический конструктор пайплайнов для диффузионных моделей: собираешь генерацию картинок, видео и аудио из узлов. Работает локально и умеет отдавать результат по API.

136 тыс.звёзд+4,7 тыс. за 30 дн.Python

openai

whisper

Эталонная модель распознавания речи от OpenAI: транскрибирует аудио на десятках языков, переводит речь и определяет язык.

110 тыс.звёзд+1,6 тыс. за 30 дн.Python

ggml-org

whisper.cpp

Whisper, переписанный на C/C++: быстро работает на обычном процессоре и на Mac, без Python и тяжёлых зависимостей. Удобно встраивать в приложения.

54 тыс.звёзд+759 за 30 дн.C++

2noise

ChatTTS

Модель синтеза речи, заточенная под живой разговорный диалог: умеет паузы, смех и интонации. Хороша для голосовых помощников и озвучки реплик.

40 тыс.звёзд+136 за 30 дн.Python

myshell-ai

OpenVoice

Мгновенное клонирование голоса: по короткому образцу переносит тембр на любой текст и позволяет менять стиль, эмоции и язык. Лицензия MIT, можно использовать в коммерции.

38 тыс.звёзд+383 за 30 дн.Python