Классический веб-интерфейс для Stable Diffusion: генерация картинок из текста, доработка, апскейл и тысячи расширений от сообщества.
Голос, видео, мультимодальностьComfy-Org
ComfyUI
Графический конструктор пайплайнов для диффузионных моделей: собираешь генерацию картинок, видео и аудио из узлов. Работает локально и умеет отдавать результат по API.
Кому подойдёт
Тем, кому нужен точный контроль над генерацией изображений и видео, а не одна кнопка.
Как начать
- Скачай десктопное приложение с comfy.org/download (Windows и macOS) — это самый простой путь.
- Или выбери ручную установку из раздела Manual Install в README: она подходит для всех ОС и типов GPU.
- Открой готовые шаблоны на comfy.org/workflows и запусти любой как есть.
Шаги взяты из README. Перед запуском сверься с актуальной версией в репозитории.
Звёзды за последние 30 дней
Описание автора
The most powerful and modular diffusion model GUI, api and backend with a graph/nodes interface. The fastest local inference engine in the world.
Ещё в категории «Голос, видео, мультимодальность»
Эталонная модель распознавания речи от OpenAI: транскрибирует аудио на десятках языков, переводит речь и определяет язык.
Клонирование голоса по очень короткому образцу: минуты записи хватает, чтобы дообучить модель синтеза речи. Есть веб-интерфейс для разметки и обучения.
Whisper, переписанный на C/C++: быстро работает на обычном процессоре и на Mac, без Python и тяжёлых зависимостей. Удобно встраивать в приложения.
Модель синтеза речи, заточенная под живой разговорный диалог: умеет паузы, смех и интонации. Хороша для голосовых помощников и озвучки реплик.
Мгновенное клонирование голоса: по короткому образцу переносит тембр на любой текст и позволяет менять стиль, эмоции и язык. Лицензия MIT, можно использовать в коммерции.
