Классический веб-интерфейс для Stable Diffusion: генерация картинок из текста, доработка, апскейл и тысячи расширений от сообщества.
Голос, видео, мультимодальностьWan-Video
Wan2.1
Открытые модели генерации видео: из текста или картинки получаешь ролик. Младшая версия 1.3B укладывается примерно в 8 ГБ видеопамяти.
Кому подойдёт
Тем, кто хочет генерировать видео локально на потребительской видеокарте.
Как начать
- Склонируй:
git clone https://github.com/Wan-Video/Wan2.1.gitиcd Wan2.1. - Поставь зависимости:
pip install -r requirements.txt. - Скачай веса:
pip install "huggingface_hub[cli]", затемhuggingface-cli download Wan-AI/Wan2.1-T2V-14B --local-dir ./Wan2.1-T2V-14B.
Шаги взяты из README. Перед запуском сверься с актуальной версией в репозитории.
Звёзды за последние 30 дней
Описание автора
Wan: Open and Advanced Large-Scale Video Generative Models
Ещё в категории «Голос, видео, мультимодальность»
Графический конструктор пайплайнов для диффузионных моделей: собираешь генерацию картинок, видео и аудио из узлов. Работает локально и умеет отдавать результат по API.
Эталонная модель распознавания речи от OpenAI: транскрибирует аудио на десятках языков, переводит речь и определяет язык.
Клонирование голоса по очень короткому образцу: минуты записи хватает, чтобы дообучить модель синтеза речи. Есть веб-интерфейс для разметки и обучения.
Whisper, переписанный на C/C++: быстро работает на обычном процессоре и на Mac, без Python и тяжёлых зависимостей. Удобно встраивать в приложения.
Модель синтеза речи, заточенная под живой разговорный диалог: умеет паузы, смех и интонации. Хороша для голосовых помощников и озвучки реплик.
