Классический веб-интерфейс для Stable Diffusion: генерация картинок из текста, доработка, апскейл и тысячи расширений от сообщества.
Голос, видео, мультимодальностьhuggingface
diffusers
Стандартная библиотека для диффузионных моделей в PyTorch: готовые пайплайны для картинок, видео и аудио, которые запускаются в несколько строк.
Кому подойдёт
Python-разработчикам, которые встраивают генерацию изображений и видео в свои продукты.
Как начать
- Установи:
pip install --upgrade diffusers[torch]. - Загрузи пайплайн:
DiffusionPipeline.from_pretrained("stable-diffusion-v1-5/stable-diffusion-v1-5", dtype=torch.float16). - Перенеси на GPU через
pipeline.to("cuda")и вызови с текстовым запросом.
Шаги взяты из README. Перед запуском сверься с актуальной версией в репозитории.
Звёзды за последние 30 дней
Описание автора
🤗 Diffusers: State-of-the-art diffusion models for image, video, and audio generation in PyTorch.
Ещё в категории «Голос, видео, мультимодальность»
Графический конструктор пайплайнов для диффузионных моделей: собираешь генерацию картинок, видео и аудио из узлов. Работает локально и умеет отдавать результат по API.
Эталонная модель распознавания речи от OpenAI: транскрибирует аудио на десятках языков, переводит речь и определяет язык.
Клонирование голоса по очень короткому образцу: минуты записи хватает, чтобы дообучить модель синтеза речи. Есть веб-интерфейс для разметки и обучения.
Whisper, переписанный на C/C++: быстро работает на обычном процессоре и на Mac, без Python и тяжёлых зависимостей. Удобно встраивать в приложения.
Модель синтеза речи, заточенная под живой разговорный диалог: умеет паузы, смех и интонации. Хороша для голосовых помощников и озвучки реплик.
