모델/Stable Cascade - 기본

Stable Cascade - 기본

허니 블론드 머리와 에메랄드 눈을 가진 여성의 사실적인 판타지 초상화로, 눈가에 눈물이 맺히고 은색 귀걸이와 목걸이를 착용한 채 위를 바라보고 있음
황금 시간대 도시 전경과 비행선이 배경인 햇살 가득한 다락 온실에서 머리카락이 휘날리고 마법 불꽃이 번쩍이는 네 명의 네오-빅토리안 영웅들.

추천 매개변수

steps

10 - 20

resolution

1024x1024

최상의 결과를 위해 주로 파인튜닝이 이루어진 스테이지 C의 36억 파라미터 버전을 사용하세요.

스테이지 B에서는 작은 세부 묘사 복원에 강한 15억 파라미터 버전을 사용하세요.

모델은 작은 잠재 공간 덕분에 효율적인 학습 및 추론에 적합하며, 파인튜닝, LoRA, ControlNet, IP-Adapter, LCM과 같은 확장 기능을 지원합니다.

모델은 연구 목적용이며, 사실적인 표현 생성이나 Stability AI의 허용 가능한 사용 정책 위반에 사용되어서는 안 됩니다.

얼굴 및 사람 이미지가 제대로 생성되지 않을 수 있으며, 모델의 자동 인코딩은 손실이 있습니다.

크리에이터 스폰서

데모:

Stable Cascade

이 모델은 Würstchen 아키텍처를 기반으로 하며, 다른 Stable Diffusion과 같은 모델들과의 주요 차이점은 훨씬 더 작은 잠재 공간에서 작동한다는 점입니다.

왜 중요할까요? 잠재 공간이 작을수록 더 빠르게 추론을 실행할 수 있고, 더 저렴하게 학습이 가능합니다.

얼마나 작은 잠재 공간인가요? Stable Diffusion은 압축 계수 8을 사용하여 1024x1024 이미지를 128x128로 인코딩합니다. Stable Cascade는 압축 계수 42를 달성하여 1024x1024 이미지를 24x24로 인코딩하면서도 선명한 복원이 가능합니다. 텍스트 조건 모델은 이렇게 고도로 압축된 잠재 공간에서 학습됩니다. 이전 버전의 이 아키텍처는 Stable Diffusion 1.5 대비 16배의 비용 절감을 이뤘습니다.<br> <br>

따라서, 효율성이 중요한 용도에 매우 적합한 모델입니다. 또한, 파인튜닝, LoRA, ControlNet, IP-Adapter, LCM 등 알려진 모든 확장 기능들이 이 방법으로도 가능합니다.

모델 세부 정보

모델 설명

Stable Cascade는 텍스트 프롬프트 입력 시 이미지를 생성하도록 훈련된 확산 모델입니다.

  • 개발자: Stability AI

  • 자금 지원: Stability AI

  • 모델 유형: 생성 텍스트-이미지 모델

모델 소스

연구 목적을 위해, 저희는 StableCascade 깃허브 저장소를 추천합니다 (https://github.com/Stability-AI/StableCascade).

모델 개요

Stable Cascade는 이미지 생성을 위한 세 개의 모델, 즉 스테이지 A, B, C로 구성되어 있어, 이름처럼 '안정적인 단계적' 생성을 구현합니다.

스테이지 A와 B는 이미지를 압축하는 역할을 하며, 이는 Stable Diffusion의 VAE와 유사합니다.

그러나 이 설정을 통해 더 높은 압축률을 달성할 수 있습니다. Stable Diffusion 모델이 8배 공간 압축을 사용해 1024 x 1024 이미지를 128 x 128로 인코딩하는 반면, Stable Cascade는 42배 압축을 달성하여 1024 x 1024 이미지를 24 x 24로 인코딩하면서 정확한 복원이 가능합니다.

이로 인해 학습과 추론 비용이 크게 절감됩니다. 또한, 스테이지 C는 텍스트 프롬프트를 받아 24 x 24 크기의 잠재 표현을 생성하는 역할을 합니다. 아래 이미지는 이를 시각적으로 보여줍니다.

이번 릴리즈에서는 스테이지 C용 체크포인트 2개, 스테이지 B용 2개, 스테이지 A용 1개를 제공합니다. 스테이지 C는 10억과 36억 파라미터 버전을 제공하지만, 대부분의 파인튜닝이 36억 버전에 이루어져 있어 이 버전 사용을 권장합니다.

스테이지 B의 두 버전은 각각 7억과 15억 파라미터이며, 둘 다 훌륭한 결과를 내지만 15억 버전이 작은 세부 묘사 복원에 뛰어납니다. 따라서 각 단계별로 더 큰 버전을 사용할 때 최상의 결과를 얻을 수 있습니다. 마지막으로, 스테이지 A는 2000만 파라미터로 크기가 작아 고정되어 있습니다.

평가

저희 평가에 따르면, Stable Cascade는 거의 모든 비교에서 프롬프트 정렬과 미적 품질 면에서 최고 성능을 보였습니다. 위 이미지는 parti-prompts(링크)와 미적 프롬프트 혼합을 사용한 인간 평가 결과를 보여줍니다. 특히 Stable Cascade(30 추론 단계)는 Playground v2(50 추론 단계), SDXL(50 추론 단계), SDXL Turbo(1 추론 단계), 그리고 Würstchen v2(30 추론 단계)와 비교되었습니다.

코드 예제

⚠️ 중요: 아래 코드를 실행하려면 diffusers의 PR이 진행 중인 이 브랜치에서 설치해야 합니다.

pip install git+https://github.com/kashif/diffusers.git@wuerstchen-v3

import torch

from diffusers import StableCascadeDecoderPipeline, StableCascadePriorPipeline

device = "cuda"

num_images_per_prompt = 2

prior = StableCascadePriorPipeline.from_pretrained("stabilityai/stable-cascade-prior", torch_dtype=torch.bfloat16).to(device)

decoder = StableCascadeDecoderPipeline.from_pretrained("stabilityai/stable-cascade", torch_dtype=torch.float16).to(device)

prompt = "Anthropomorphic cat dressed as a pilot"

negative_prompt = ""

prior_output = prior(

prompt=prompt,

height=1024,

width=1024,

negative_prompt=negative_prompt,

guidance_scale=4.0,

num_images_per_prompt=num_images_per_prompt,

num_inference_steps=20

)

decoder_output = decoder(

image_embeddings=prior_output.image_embeddings.half(),

prompt=prompt,

negative_prompt=negative_prompt,

guidance_scale=0.0,

output_type="pil",

num_inference_steps=10

).images

#이제 decoder_output은 PIL 이미지 리스트입니다

활용법

직접 사용

이 모델은 현재 연구 목적을 위해 설계되었습니다. 가능한 연구 영역 및 작업은 다음과 같습니다.

  • 생성 모델에 대한 연구.

  • 유해 콘텐츠 생성 가능성이 있는 모델의 안전한 배포.

  • 생성 모델의 한계 및 편향성 조사 및 이해.

  • 예술 작품 생성 및 디자인 등 예술적 과정에 활용.

  • 교육적 또는 창작 도구로의 응용.

제외되는 사용 사례는 아래에 설명되어 있습니다.

적용 범위 외 사용

이 모델은 사람이나 사건에 대한 사실적 또는 진실한 표현을 위해 훈련되지 않았으므로, 그러한 콘텐츠 생성을 목적으로 하는 사용은 모델 능력의 범위를 벗어납니다.

또한 모델은 Stability AI의 허용 가능한 사용 정책를 위반하는 방식으로 사용되어서는 안 됩니다.

제한 사항 및 편향

제한 사항

  • 얼굴과 일반적인 사람 인식이 제대로 생성되지 않을 수 있습니다.

  • 모델의 자동 인코딩 부분은 손실이 발생합니다.

권장 사항

이 모델은 연구 용도로만 사용하도록 설계되었습니다.

모델 시작 가이드

자세한 내용은 https://github.com/Stability-AI/StableCascade 를 확인하세요.

이전
Midnight - v5.0
다음
필름 에뮬레이션 - 할레이션 35mm (미묘한)

모델 세부사항

모델 유형

Checkpoint

기본 모델

Stable Cascade

모델 버전

base

모델 해시

0d28c8562d

제작자

토론

댓글을 남기려면 log in하세요.

Stable Cascade - 기본 제작 이미지

허니 블론드 머리와 에메랄드 눈을 가진 여성의 사실적인 판타지 초상화로, 눈가에 눈물이 맺히고 은색 귀걸이와 목걸이를 착용한 채 위를 바라보고 있음
황금 시간대 도시 전경과 비행선이 배경인 햇살 가득한 다락 온실에서 머리카락이 휘날리고 마법 불꽃이 번쩍이는 네 명의 네오-빅토리안 영웅들.

애니메 이미지

로봇 팔을 가진 사이버펑크 여성이 목조 바닥과 미닫이문이 있는 전통 일본식 방에서 분재를 신중하게 다듬는 애니메이션 스타일의 이미지.
붉은 피부와 검은 뿔을 가진 성숙한 아카-오니 여성이 얼굴 일부를 가린 푸른 머리로 한쪽 눈을 문지르며 뿔달린 봉제인형을 들고 있는 부드럽고 세밀한 조명 속 모습.
매우 긴 다채로운 머리카락을 가진 봄의 여신이 흰색 흐르는 드레스를 입고 평화롭게 연꽃과 식물 사이에 앉아 있으며, 맑은 파란 하늘 아래 새들이 날아다니고 있습니다.
길고 갈색 머리를 가진 여성이 하얀 블라우스와 검은 체크 무늬 치마를 입고 밝은 파란 하늘 아래 새들이 날아다니는 구름 위 높은 좁은 나무 다리를 걷고 있다.
붉은 케이블과 네온 블루 조명이 있는 분할된 로봇 수트를 입고 긴 갈색 머리를 가진 여성 사이보그가 미래적인 사이버펑크 환경에서 떠 있는 디지털 아트워크.
흰 머리와 피부에 천상의 액체 같은 패턴이 있는 추상 애니메 소녀 클로즈업과 복잡하게 패턴화된 추상 배경.
덴im 작업복과 고글을 착용한 파란 머리 여성이 녹슨 금속 탱크에 앉아 있는 디지털 일러스트레이션, 푹신한 구름으로 가득한 하늘을 배경으로 함.
생물 발광 조류와 걸이등으로 밝혀진 침수된 버려진 아트 데코 식당에서 짧은 머리의 여성 방랑자가 무릎까지 차오른 물 속을 맨발로 걷고 있다.
사막 섬의 구름 위에 큰 원형 우주항이 떠 있고, 미래형 장갑 수트를 입은 인물이 바위가 많은 지형에 서서 이를 바라보는 공상과학 장면.
부드러운 자연광 아래 콘크리트 난간에 하얀 셔츠와 파란 바지를 입고 앉아 있는 긴 어두운 머리의 소녀 디지털 페인팅, 도시 질감의 벽 배경

예술 이미지

짙은 안개 속에서 주황색과 파란색 불빛이 반짝이는 높은 고층 빌딩들이 있는 미래 도시 풍경, 구름 위에 떠 있는 큰 원형 구조물이 중앙에 위치함.
감정적 강도와 혼란스러운 에너지를 전달하는 오렌지, 파랑, 빨강, 검정의 스플래시와 폭발적인 붓 터치로 만들어진 눈을 감은 얼굴이 강조된 클로즈업 추상 초상화
검은 배경에 생생한 빨간 얼굴, 노란 눈, 정교한 흑백 패턴과 깃털 같은 털 질감이 표현된 Mandrill 머리의 매우 상세한 디지털 일러스트.
비 오는 밤에 사람 위에 드리운 빨간색과 검은색 용의 스케치.
어두운 배경 위에 강렬한 빨강, 흰색, 검정 색상의 수중 금붕어를 그린 추상 아크릴화
복합된 나폴레옹 시대와 사이버펑크 스타일의 우아한 금장 해군 제복을 입은 진홍색 머리와 파란 눈을 가진 결연한 군사 지휘관의 초상화, 연기 낀 도시 요새에 서 있음.
주근깨가 있는 엘프 Hemomancer 여성의 정교한 초상화로, 주홍색 후드와 로브를 입고 피처럼 붉은 눈과 복잡한 마법 기호들이 어두운 숲 동굴에서 소용돌이치는 모습입니다.
베이지색 배경에 서 있는 여성의 실루엣과 그녀 주변으로 붉은색, 노란색, 파란색, 주황색, 보라색의 선명한 프랙탈 같은 페인트 스플래시.
검은 가죽 브라렛과 하이웨이스트 와이드 팬츠를 입고 팔을 뻗으며 자신감 있게 서 있는 스타일리시한 여성. 그녀는 긴 땋은 머리와 밝은 녹색 플랫폼 힐을 신고 있습니다. 배경은 녹색 톤과 그림자 패턴으로 구성되어 있습니다.
코트다쥐르 해안을 배경으로 푸른 하늘과 흰 구름, 비행기 꼬리 구름이 가득한 남프랑스 캡 카나이유 해변을 걸어가는 날씬한 여성 실루엣을 보여주는 미니멀리스트 평면 벡터 아트워크.

기본 모델 이미지

어둡고 불길한 하늘 아래 빛나는 잭오랜턴 조명으로 밝힌 음산한 무덤을 걷는 좀비와 해골을 포함한 언데드 캐릭터들의 사진 같은 장면.

logo 이미지

무릎을 꿇고 권총을 들고 있는 타이트한 파란색과 흰색 보디수트를 입은 Overwatch의 D.VA 디지털 아트, 배경에는 분홍빛 톤으로 된 그녀의 갈색 눈 얼굴 클로즈업이 큼지막하게 자리함.
줄무늬 직원 셔츠를 입은 큰 오징어 같은 인간형 캐릭터가 즉석 라면 컵과 다양한 물품이 가득한 가게 계산대 뒤에 서 있는 모습을 세밀한 선형 해칭과 어스톤 색조로 그린 일러스트.
스팀펑크 스타일 커피 머신과 미소 짓는 소녀, 수채화 스케치.
아이소메트릭 격자 위에서 검을 들고 있는 블루 아카이브의 치비 시로코 픽셀 아트.
Stable Diffusion을 사용하여 AI가 생성한 다양한 과일과 켜진 촛불이 있는 세밀한 정물화.

리얼리즘 이미지

검은색 민소매 상의와 복잡한 금속 목걸이를 착용한 짧은 머리의 젊은이 초상화로, 창문 근처에서 연기를 내뿜고 있습니다.
털이 덥수룩한 갈색과 회색 털을 가진 의인화된 개가 폼폼이 장식이 달린 어두운 니트 비니, 더러운 녹색 재킷, 어두운 바지, 크고 더러운 운동화를 신고 젖은 도시 바닥에 서 있으며 배경에는 흐릿한 도시 건물이 있습니다.
흐르는 빨간 머리와 모피 망토, 가죽 갑옷을 입고 부족 문신으로 장식된 칼을 들고 곰 옆에 서 있는 판타지 전사 여성.
도심 거리에서 검은 슈트를 입은 배트맨이 발목 깊이 잠긴 홍수 물 속 흰색 플라스틱 의자에 앉아 무거운 비를 맞으며 맥주 병을 들고 있습니다.
황금 기계 부품과 로봇의 우아함을 갖춘 미래형 스팀펑크 사이보그 여성의 측면 프로필, 극적인 어두운 배경과 황금빛 튀김이 어우러져 있습니다.
주근깨와 회녹색 눈을 가진 빨간 머리 소녀가 녹색 실크 로브를 입고 영화 같은 조명이 있는 어두운 아파트에서 나무 탁자 위에 기대어 투명 유리어항에 있는 베타 물고기에게 먹이를 주고 있습니다.
단색 보라색 배경을 배경으로 정교한 기계 부품이 있는 현실적인 여성 안드로이드의 옆모습.
금색 기하학적 무늬가 있는 흰색 오프숄더 드레스와 주황색 틴트 안경, 주황색 소용돌이 치는 후광을 머리 뒤에 두른 어두운 비대칭 어깨 길이 검은 머리와 붉은 입술의 스타일리시한 젊은 한국 여성. 짙은 청록색 배경.
긴 곱슬 갈색 머리를 가진 젊은 여성이 구름 낀 하늘 아래 흰 야생화가 만발한 푸른 산악 초원에서 검은 리본 장식이 있는 핏된 회색 꽃무늬 민소매 드레스를 입고 서 있습니다.