Stable Diffusion — перехожу с MJ, потому что надоело платить. Но есть нюансы

В общем, решил наконец слезть с иглы Midjourney и полноценно пересесть на SD. Полгода откладывал, казалось, что сложно, куча настроек, контроль нетов, лор — голова пухнет. Но пару недель поковырялся — и уже не представляю, как без этого жил.

Почему перешел (и вам советую):

  • Бесплатно. Ну, почти. Запустил локально на своей 3060, 12GB — тянет SDXL нормально, генерация 1024х1024 за 15-20 секунд. Платить никому не надо.

  • Полный контроль. Хочешь ControlNet — пожалуйста. Хочешь дообуть лору под свой стиль — 2 часа и готово. В MJ ты просишь, а тут — командуешь.

  • Open source. Вышла новая фича — через неделю уже в автономной сборке. Не надо ждать, пока Дэвид Хольц решит добавить.

С чем намучался (чтоб вы знали):

1. Установка. Скачал Automatic1111 — работало, но жрало память как не в себя. Перелез на ComfyUI — там вообще ад для новичка, эти ноды, провода… Но после пары туториалов понял, что оно того стоит. Гибкость дикая. Например, можно собрать пайплайн: генерация → апскейл → лицо фикс → ресайз → выгрузка. Всё автоматически.

2. Сборка нормальных чекпойнтов. Стоковая SDXL выдает мыло. Накачал с Civitai пяток популярных: Juggernaut XL, RealVisXL, DreamShaper. Juggernaut пока фаворит — реализм без пластиковых лиц. Для аниме — Animagine XL.

3. ControlNet — это магия. Кидаешь набросок позы, и нейросеть строго по нему генерит. Или берешь готовое фото, выдергиваешь глубину (depth) — и перерисовываешь в любом стиле, сохраняя композицию. OpenPose вообще спас для генерации персонажей в движении. Без него руки-ноги вкривь и вкось.

Моя текущая базовая сборка (для реализма):

text
Модель: Juggernaut XL v6
Семплер: DPM++ 2M Karras
Шаги: 30
CFG: 7
Разрешение: 1024x1024
Хайрес фикс: 1.5x с апскейлером 4x_NMKD
ControlNet: по ситуации (чаще всего depth или canny)

Что еще использую:

  • ADetailer — отдельно дорисовывает лица, когда на общем плане глаза кривые. Спас от тонны правок.

  • LORA под текстуры — натренировал свою на 30 фото ржавого металла. Теперь лепит идеальную коррозию с первого промта.

  • Tiled VAE — чтобы 2048×2048 не падало с out of memory.

В чем еще плаваю (вопросы к старожилам):

  1. Скорость. 15-20 сек на 1024 это норма для 3060? Или можно быстрее через какие-то оптимизации? Слышал про TensorRT, но боюсь лезть.

  2. Лица в полный рост. На средних и дальних планах лица всё равно мыльные. ADetailer помогает, но не всегда. Может есть лора или чекпойнт специальный?

  3. Что лучше вместо Automatic1111? Пробовал ComfyUI — мощно, но геморройно. ReForge, SD.Next — кто что юзает и почему?

  4. Вопрос к тем, кто генерит видео. SD + AnimateDiff — реально рабочий пайплайн или всё ещё игрушка? Пробовал — у меня кадры дергаются, хотя ControlNet использовал.

Короче, мужики, Stable Diffusion — это сила, но порог входа выше, чем у джойки за 10 баксов в месяц. Если вы готовы потратить вечер на настройку — откроется космос. Если хочется “нажал и получил” — оставайтесь на MJ или DALL-E.

Выкладывайте свои сборки, чекпойнты, лоры. Кто как ускоряет и фиксит лица — особенно интересно.

P.S. Отдельный респект тем, кто шарит в LoRA тренировке под конкретные объекты. Натренировал на свои фотки — теперь генерит мою рожу в любых ракурсах. Коллеги офигевают. Если надо — сделаю отдельный пост с туториалом по Kohya SS.