Stable Diffusion — перехожу с MJ, потому что надоело платить. Но есть нюансы
Цитата: Valintag от 18.05.2026, 19:26В общем, решил наконец слезть с иглы Midjourney и полноценно пересесть на SD. Полгода откладывал, казалось, что сложно, куча настроек, контроль нетов, лор — голова пухнет. Но пару недель поковырялся — и уже не представляю, как без этого жил.
Почему перешел (и вам советую):
Бесплатно. Ну, почти. Запустил локально на своей 3060, 12GB — тянет SDXL нормально, генерация 1024х1024 за 15-20 секунд. Платить никому не надо.
Полный контроль. Хочешь ControlNet — пожалуйста. Хочешь дообуть лору под свой стиль — 2 часа и готово. В MJ ты просишь, а тут — командуешь.
Open source. Вышла новая фича — через неделю уже в автономной сборке. Не надо ждать, пока Дэвид Хольц решит добавить.
С чем намучался (чтоб вы знали):
1. Установка. Скачал Automatic1111 — работало, но жрало память как не в себя. Перелез на ComfyUI — там вообще ад для новичка, эти ноды, провода… Но после пары туториалов понял, что оно того стоит. Гибкость дикая. Например, можно собрать пайплайн: генерация → апскейл → лицо фикс → ресайз → выгрузка. Всё автоматически.
2. Сборка нормальных чекпойнтов. Стоковая SDXL выдает мыло. Накачал с Civitai пяток популярных: Juggernaut XL, RealVisXL, DreamShaper. Juggernaut пока фаворит — реализм без пластиковых лиц. Для аниме — Animagine XL.
3. ControlNet — это магия. Кидаешь набросок позы, и нейросеть строго по нему генерит. Или берешь готовое фото, выдергиваешь глубину (depth) — и перерисовываешь в любом стиле, сохраняя композицию. OpenPose вообще спас для генерации персонажей в движении. Без него руки-ноги вкривь и вкось.
Моя текущая базовая сборка (для реализма):
textМодель: Juggernaut XL v6 Семплер: DPM++ 2M Karras Шаги: 30 CFG: 7 Разрешение: 1024x1024 Хайрес фикс: 1.5x с апскейлером 4x_NMKD ControlNet: по ситуации (чаще всего depth или canny)Что еще использую:
ADetailer — отдельно дорисовывает лица, когда на общем плане глаза кривые. Спас от тонны правок.
LORA под текстуры — натренировал свою на 30 фото ржавого металла. Теперь лепит идеальную коррозию с первого промта.
Tiled VAE — чтобы 2048×2048 не падало с out of memory.
В чем еще плаваю (вопросы к старожилам):
Скорость. 15-20 сек на 1024 это норма для 3060? Или можно быстрее через какие-то оптимизации? Слышал про TensorRT, но боюсь лезть.
Лица в полный рост. На средних и дальних планах лица всё равно мыльные. ADetailer помогает, но не всегда. Может есть лора или чекпойнт специальный?
Что лучше вместо Automatic1111? Пробовал ComfyUI — мощно, но геморройно. ReForge, SD.Next — кто что юзает и почему?
Вопрос к тем, кто генерит видео. SD + AnimateDiff — реально рабочий пайплайн или всё ещё игрушка? Пробовал — у меня кадры дергаются, хотя ControlNet использовал.
Короче, мужики, Stable Diffusion — это сила, но порог входа выше, чем у джойки за 10 баксов в месяц. Если вы готовы потратить вечер на настройку — откроется космос. Если хочется “нажал и получил” — оставайтесь на MJ или DALL-E.
Выкладывайте свои сборки, чекпойнты, лоры. Кто как ускоряет и фиксит лица — особенно интересно.
P.S. Отдельный респект тем, кто шарит в LoRA тренировке под конкретные объекты. Натренировал на свои фотки — теперь генерит мою рожу в любых ракурсах. Коллеги офигевают. Если надо — сделаю отдельный пост с туториалом по Kohya SS.
В общем, решил наконец слезть с иглы Midjourney и полноценно пересесть на SD. Полгода откладывал, казалось, что сложно, куча настроек, контроль нетов, лор — голова пухнет. Но пару недель поковырялся — и уже не представляю, как без этого жил.
Почему перешел (и вам советую):
-
Бесплатно. Ну, почти. Запустил локально на своей 3060, 12GB — тянет SDXL нормально, генерация 1024х1024 за 15-20 секунд. Платить никому не надо.
-
Полный контроль. Хочешь ControlNet — пожалуйста. Хочешь дообуть лору под свой стиль — 2 часа и готово. В MJ ты просишь, а тут — командуешь.
-
Open source. Вышла новая фича — через неделю уже в автономной сборке. Не надо ждать, пока Дэвид Хольц решит добавить.
С чем намучался (чтоб вы знали):
1. Установка. Скачал Automatic1111 — работало, но жрало память как не в себя. Перелез на ComfyUI — там вообще ад для новичка, эти ноды, провода… Но после пары туториалов понял, что оно того стоит. Гибкость дикая. Например, можно собрать пайплайн: генерация → апскейл → лицо фикс → ресайз → выгрузка. Всё автоматически.
2. Сборка нормальных чекпойнтов. Стоковая SDXL выдает мыло. Накачал с Civitai пяток популярных: Juggernaut XL, RealVisXL, DreamShaper. Juggernaut пока фаворит — реализм без пластиковых лиц. Для аниме — Animagine XL.
3. ControlNet — это магия. Кидаешь набросок позы, и нейросеть строго по нему генерит. Или берешь готовое фото, выдергиваешь глубину (depth) — и перерисовываешь в любом стиле, сохраняя композицию. OpenPose вообще спас для генерации персонажей в движении. Без него руки-ноги вкривь и вкось.
Моя текущая базовая сборка (для реализма):
Модель: Juggernaut XL v6 Семплер: DPM++ 2M Karras Шаги: 30 CFG: 7 Разрешение: 1024x1024 Хайрес фикс: 1.5x с апскейлером 4x_NMKD ControlNet: по ситуации (чаще всего depth или canny)
Что еще использую:
-
ADetailer — отдельно дорисовывает лица, когда на общем плане глаза кривые. Спас от тонны правок.
-
LORA под текстуры — натренировал свою на 30 фото ржавого металла. Теперь лепит идеальную коррозию с первого промта.
-
Tiled VAE — чтобы 2048×2048 не падало с out of memory.
В чем еще плаваю (вопросы к старожилам):
-
Скорость. 15-20 сек на 1024 это норма для 3060? Или можно быстрее через какие-то оптимизации? Слышал про TensorRT, но боюсь лезть.
-
Лица в полный рост. На средних и дальних планах лица всё равно мыльные. ADetailer помогает, но не всегда. Может есть лора или чекпойнт специальный?
-
Что лучше вместо Automatic1111? Пробовал ComfyUI — мощно, но геморройно. ReForge, SD.Next — кто что юзает и почему?
-
Вопрос к тем, кто генерит видео. SD + AnimateDiff — реально рабочий пайплайн или всё ещё игрушка? Пробовал — у меня кадры дергаются, хотя ControlNet использовал.
Короче, мужики, Stable Diffusion — это сила, но порог входа выше, чем у джойки за 10 баксов в месяц. Если вы готовы потратить вечер на настройку — откроется космос. Если хочется “нажал и получил” — оставайтесь на MJ или DALL-E.
Выкладывайте свои сборки, чекпойнты, лоры. Кто как ускоряет и фиксит лица — особенно интересно.
P.S. Отдельный респект тем, кто шарит в LoRA тренировке под конкретные объекты. Натренировал на свои фотки — теперь генерит мою рожу в любых ракурсах. Коллеги офигевают. Если надо — сделаю отдельный пост с туториалом по Kohya SS.
