modele/Stable Cascade - baza

Stable Cascade - baza

|
9/20/2025
|
12:58:35 PM
| Discussion
Realistyczny fantastyczny portret kobiety z miodowo-blond włosami i szmaragdowymi oczami, patrzącej w górę z łzą na policzku, noszącej srebrne kolczyki i naszyjnik.
Cztery neo-wiktoriańskie bohaterki w oświetlonej słońcem strychowej konserwatorii z falującymi włosami i magicznymi iskrami, na tle panoramy miasta z sterowcami podczas złotej godziny.

Zalecane parametry

steps

10 - 20

resolution

1024x1024

Wskazówki

Używaj wersji Etapu C z 3,6 miliardami parametrów dla najlepszych wyników, ponieważ główne finetuning wykonano na niej.

Wariant Etapu B z 1,5 miliarda parametrów doskonale odtwarza małe i drobne detale.

Model jest dobrze przystosowany do efektywnego trenowania i wnioskowania dzięki mniejszej przestrzeni latentnej i obsługuje rozszerzenia takie jak finetuning, LoRA, ControlNet, IP-Adapter i LCM.

Model jest przeznaczony wyłącznie do celów badawczych i nie powinien być używany do generowania prawdziwych reprezentacji ani naruszania Polityki Akceptowalnego Użytku Stability AI.

Twarze i ludzie mogą nie być generowani poprawnie, ponieważ autoenkodowanie modelu jest stratne.

Sponsorzy twórcy

Demonstracje:

Stable Cascade

Model ten jest oparty na architekturze Würstchen, a jego główną

różnicą w stosunku do innych modeli, takich jak Stable Diffusion, jest działanie w znacznie mniejszej przestrzeni latentnej. Dlaczego to

jest istotne? Im mniejsza przestrzeń latentna, tym szybsze można przeprowadzać wnioskowanie i tańsze staje się trenowanie.

Jak mała jest ta przestrzeń latentna? Stable Diffusion używa współczynnika kompresji 8, co powoduje, że obraz 1024x1024 jest

kodowany do rozmiaru 128x128. Stable Cascade osiąga współczynnik kompresji 42, co oznacza możliwość zakodowania obrazu

1024x1024 do 24x24, zachowując przy tym ostre rekonstrukcje. Model warunkowany tekstem jest trenowany w

silnie skompresowanej przestrzeni latentnej. Poprzednie wersje tej architektury osiągnęły 16-krotną redukcję kosztów względem Stable

Diffusion 1.5. <br> <br>

Dlatego ten rodzaj modelu jest dobrze dopasowany do zastosowań, w których ważna jest wydajność. Ponadto wszystkie znane rozszerzenia

takie jak finetuning, LoRA, ControlNet, IP-Adapter, LCM itd. są możliwe również z tym podejściem.

Szczegóły modelu

Opis modelu

Stable Cascade to model dyfuzyjny trenowany do generowania obrazów na podstawie tekstowego opisu.

  • Opracowany przez: Stability AI

  • Finansowany przez: Stability AI

  • Typ modelu: Generatywny model tekst-na-obraz

Źródła modelu

Na potrzeby badań polecamy nasze StableCascade repozytorium Github (https://github.com/Stability-AI/StableCascade).

Przegląd modelu

Stable Cascade składa się z trzech modeli: Etap A, Etap B i Etap C, tworzących kaskadę do generowania obrazów,

skąd pochodzi nazwa „Stable Cascade”.

Etapy A i B służą do kompresji obrazów, podobnie jak zadanie VAE w Stable Diffusion.

Jednak dzięki temu rozwiązaniu można osiągnąć znacznie wyższą kompresję obrazów. Podczas gdy modele Stable Diffusion używają

czynnika kompresji przestrzennej 8, kodując obraz o rozdzielczości 1024 x 1024 do 128 x 128, Stable Cascade osiąga

czynnik kompresji 42. To koduje obraz 1024 x 1024 do 24 x 24, przy jednoczesnym dokładnym dekodowaniu

obrazu. Przynosi to wielką korzyść w postaci tańszego trenowania i wnioskowania. Ponadto, etap C odpowiada

za generowanie małych latentów 24 x 24 na podstawie tekstowego opisu. Poniższe zdjęcie pokazuje to wizualnie.

Na tę wersję udostępniamy dwa checkpointy dla Etapu C, dwa dla Etapu B i jeden dla Etapu A. Etap C ma wersję z

1 miliardem oraz 3,6 miliardem parametrów, ale zdecydowanie zalecamy użycie wersji 3,6 miliarda, ponieważ na niej wykonano główne finetuning.

Dwie wersje Etapu B zawierają odpowiednio 700 milionów i 1,5 miliarda parametrów. Obie osiągają

świetne wyniki, jednak wariant 1,5 miliarda wyróżnia się w odtwarzaniu małych i drobnych detali. Dlatego uzyskasz

najlepsze efekty, używając większej wersji każdego z etapów. Na koniec, etap A zawiera 20 milionów parametrów i jest stały ze względu na

swoją niewielką wielkość.

Ocena

Według naszych ocen, Stable Cascade wypada najlepiej zarówno pod względem zgodności z opisem, jak i jakości estetycznej w prawie wszystkich

porównaniach. Powyższe zdjęcie przedstawia wyniki oceny ludzkiej, używającej mieszanki parti-prompts (link) i estetycznych promptów. Konkretne porównanie Stable Cascade (30 kroków wnioskowania) z Playground v2 (50 kroków wnioskowania), SDXL (50 kroków wnioskowania), SDXL Turbo (1 krok wnioskowania) oraz Würstchen v2 (30 kroków wnioskowania).

Przykład kodu

⚠️ Ważne: Aby poniższy kod działał, musisz zainstalować diffusers z tej gałęzi podczas gdy PR jest w toku.

pip install git+https://github.com/kashif/diffusers.git@wuerstchen-v3

import torch

from diffusers import StableCascadeDecoderPipeline, StableCascadePriorPipeline

device = "cuda"

num_images_per_prompt = 2

prior = StableCascadePriorPipeline.from_pretrained("stabilityai/stable-cascade-prior", torch_dtype=torch.bfloat16).to(device)

decoder = StableCascadeDecoderPipeline.from_pretrained("stabilityai/stable-cascade", torch_dtype=torch.float16).to(device)

prompt = "Anthropomorphic cat dressed as a pilot"

negative_prompt = ""

prior_output = prior(

prompt=prompt,

height=1024,

width=1024,

negative_prompt=negative_prompt,

guidance_scale=4.0,

num_images_per_prompt=num_images_per_prompt,

num_inference_steps=20

)

decoder_output = decoder(

image_embeddings=prior_output.image_embeddings.half(),

prompt=prompt,

negative_prompt=negative_prompt,

guidance_scale=0.0,

output_type="pil",

num_inference_steps=10

).images

#Teraz decoder_output to lista z twoimi obrazami PIL

Zastosowania

Bezpośrednie użycie

Model jest obecnie przeznaczony wyłącznie do celów badawczych. Możliwe obszary badań i zadania obejmują

  • Badania nad modelami generatywnymi.

  • Bezpieczne wdrażanie modeli, które mogą generować szkodliwe treści.

  • Analizowanie i rozumienie ograniczeń oraz uprzedzeń modeli generatywnych.

  • Generowanie dzieł sztuki oraz zastosowanie w projektowaniu i innych procesach artystycznych.

  • Zastosowania w narzędziach edukacyjnych lub kreatywnych.

Wyłączone zastosowania opisano poniżej.

Zastosowania poza zakresem

Model nie był trenowany do wiernego lub prawdziwego odzwierciedlania ludzi lub wydarzeń,

dlatego używanie modelu do generowania takich treści jest poza jego możliwościami.

Model nie powinien być używany w sposób naruszający Politykę Akceptowalnego Użytku Stability AI.

Ograniczenia i uprzedzenia

Ograniczenia

  • Twarz i ludzie w ogóle mogą nie być generowani poprawnie.

  • Część autoenkodująca modelu jest stratna.

Rekomendacje

Model przeznaczony jest wyłącznie do celów badawczych.

Jak zacząć pracę z modelem

Sprawdź https://github.com/Stability-AI/StableCascade

Poprzedni
Midnight - v5.0
Następny
Emulacja filmu - Halation 35mm (Subtelny)

Szczegóły modelu

Typ modelu

Checkpoint

Model bazowy

Stable Cascade

Wersja modelu

base

Hash modelu

0d28c8562d

Dyskusja

Proszę się log in, aby dodać komentarz.

Obrazy autorstwa Stable Cascade - baza

Realistyczny fantastyczny portret kobiety z miodowo-blond włosami i szmaragdowymi oczami, patrzącej w górę z łzą na policzku, noszącej srebrne kolczyki i naszyjnik.
Cztery neo-wiktoriańskie bohaterki w oświetlonej słońcem strychowej konserwatorii z falującymi włosami i magicznymi iskrami, na tle panoramy miasta z sterowcami podczas złotej godziny.

Obrazy z anime

Dojrzała Aka-Oni kobieta z czerwoną skórą i czarnymi rogami, niebieskie włosy częściowo zasłaniające twarz, pocierająca jedno oko, trzymając pluszaka z rogami, w miękkim, szczegółowym oświetleniu.
Bogini wiosny z bardzo długimi wielobarwnymi włosami, ubrana w płynną białą suknię, siedzi spokojnie wśród kwiatów lotosu i roślinności o wschodzie słońca, z ptakami latającymi na tle czystego niebieskiego nieba.
Kobieta o długich brązowych włosach w białej bluzce i czarnej spódnicy w kratę spaceruje wąskim drewnianym mostem wysoko nad chmurami pod jasnym niebieskim niebem pełnym szybujących ptaków.
Cyfrowa grafika kobiety cyborg z długimi brązowymi włosami unoszącej się w futurystycznym środowisku cyberpunk, ubranej w segmentowany robotyczny kombinezon z czerwonymi kablami i neonowym niebieskim oświetleniem.
Zbliżenie abstrakcyjnej dziewczyny anime z białymi włosami i niebiańsko-cieczopodobnymi wzorami na skórze oraz gęsto wzorzystym abstrakcyjnym tle.
Cyfrowa ilustracja kobiety z niebieskimi włosami siedzącej na zardzewiałym metalowym czołgu, ubranej w dżinsowe ogrodniczki i gogle, na tle nieba pełnego puszystych chmur.
Wędrowniczka z krótkimi włosami chodzi boso przez wodę sięgającą do kolan w zalanej, opuszczonej jadłodajni art deco oświetlonej bioluminescencyjnymi algami i wiszącymi lampami.
Scena science fiction przedstawiająca duży okrągły port kosmiczny unoszący się nad pustynną wyspą z chmurami, podczas gdy postać w futurystycznym opancerzonym kombinezonie stoi na skalistym terenie i obserwuje go.
Cyfrowy obraz dziewczyny o długich ciemnych włosach siedzącej na betonowym murku, ubranej w białą koszulę i niebieskie spodnie, skąpanej w miękkim naturalnym świetle, na tle miejskiej, teksturowanej ściany
Scena fantasy przedstawiająca przerażoną elfkę z długimi, jasnobrązowymi włosami i przenikliwymi zielonymi oczami, trzymającą płonącą pochodnię w ciemnej jaskini, podczas gdy za nią unosi się szkielet z świecącymi oczami.

Obrazy z sztuka

Futurystyczny krajobraz miejski z wysokimi drapaczami chmur z pomarańczowymi i niebieskimi światłami wśród gęstej mgły, skoncentrowany na dużej unoszącej się okrągłej konstrukcji ponad chmurami.
Zbliżenie abstrakcyjnego portretu przedstawiającego twarz z zamkniętymi oczami, wykonane tuszem trójkolorowym z eksplodującymi pociągnięciami pędzla, rozpryskami pomarańczowego, niebieskiego, czerwonego i czarnego, wyrażające emocjonalną intensywność i chaotyczną energię.
Szczegółowa cyfrowa ilustracja głowy mandryla z jaskrawoczerwoną twarzą, żółtymi oczami, misternymi czarno-białymi wzorami i pióropodobną teksturą futra na czarnym tle.
Czerwono-czarny szkic smoka górującego nad osobą w deszczu w nocy.
Abstrakcyjny obraz akrylowy złotej rybki pod wodą z uderzającymi czerwonymi, białymi i czarnymi kolorami na ciemnym tle
Portret zdeterminowanego dowódcy wojskowego o rudych włosach i niebieskich oczach, ubranego w elegancki granatowy mundur ze złotymi akcentami, łączący styl epoki napoleońskiej i cyberpunk, stojącego w zadymionej miejskiej twierdzy.
Szczegółowy portret pieprzniętej elfiej hemomancerki ubranej w szkarłatny kaptur i szaty, z krwistoczerwonymi oczami i skomplikowanymi magicznymi symbolami wirującymi w ciemnej jaskini leśnej.
Sylwetka kobiety stojącej na tle beżowego tła z żywymi kolorowymi fraktalnymi rozbryskami farby w kolorach czerwonym, żółtym, niebieskim, pomarańczowym i fioletowym wokół niej.
Stylowa kobieta w czarnym skórzanym bralecie i spodniach z wysokim stanem i szerokimi nogawkami, stojąca pewnie z wyciągniętymi ramionami. Ma długie warkocze i jaskrawozielone koturny. Tło zawiera zielone tony z wzorami cieni.
Minimalistyczna płaska grafika wektorowa przedstawiająca sylwetkę szczupłej kobiety spacerującej po plaży Cap Canaille, Południowa Francja, z dużym niebieskim niebem wypełnionym białymi chmurami i smugami kondensacyjnymi nad wybrzeżem Côte d'Azur.

Obrazy z model bazowy

Fotorealistyczna scena postaci nieumarłych, w tym zombie i szkieletów, spacerujących przez upiorny cmentarz oświetlony świecącymi lampionami jack-o'-lantern pod ciemnym, złowrogim niebem.

Obrazy z logo

Cyfrowa sztuka D.VA z Overwatch w obcisłym niebiesko-białym kombinezonie, trzymającej pistolet, klęczącej, z dużym zbliżeniem na jej twarz o brązowych oczach w różowych tonach w tle.
Ilustracja dużej humanoidalnej postaci przypominającej kałamarnicę w pasiastym ubraniu pracowniczym stojącej za ladą sklepową wypełnioną kubkami z zupkami chińskimi i różnymi przedmiotami, narysowana szczegółowym liniowym kreskowaniem w ziemistych tonach.
Ekspres do kawy w stylu steampunk z uśmiechniętą dziewczyną, szkic akwarelowy.
Pixel art chibi Shiroko z Blue Archive z mieczem na izometrycznej siatce.
Szczegółowa martwa natura z różnymi owocami i palącymi się świecami, wygenerowana przez AI przy użyciu Stable Diffusion.

Obrazy z realizm

Bardzo szczegółowy antropomorficzny pies z kędzierzawą brązową i szarą sierścią, noszący ciemną dzianinową czapkę z pomponem, brudną zieloną kurtkę, ciemne spodnie i za duże, brudne sneakersy stojący na mokrej miejskiej nawierzchni z rozmytymi budynkami miasta w tle.
Fantastyczna wojowniczka z płynącymi rudymi włosami, ubrana w futrzany płaszcz i skórzaną zbroję, ozdobiona tatuażami plemiennymi i trzymająca miecz, stojąca obok niedźwiedzia.
Batman w czarnym kostiumie siedzi na białym plastikowym krześle zanurzonym w wodzie powodziowej do kostek, trzymając butelkę piwa pod ulewą na miejskiej ulicy.
Profil boczny futurystycznej steampunkowej kobiety cyborga ze złotymi mechanicznymi częściami i robotyczną elegancją, na tle dramatycznego ciemnego tła z złotymi plamami.
Ruda dziewczyna z piegami i szarozielonymi oczami pochyla się nad drewnianym stołem, karmiąc rybkę betta w szklanej misce, ubrana w zielony jedwabny szlafrok, osadzona w ciemnym mieszkaniu z kinowym oświetleniem.
Widok profilu bocznego realistycznego kobiecego androida z detalicznymi częściami mechanicznymi na jednolitym fioletowym tle.
Stylowa młoda Koreańska kobieta z ciemnymi asymetrycznymi włosami do ramion i czerwonymi ustami, ubrana w białą sukienkę odsłaniającą ramiona z złotymi geometrycznymi wzorami, pomarańczowe przezroczyste okulary oraz pomarańczową spiralną aureolą za głową na ciemnym turkusowym tle.
Młoda kobieta o długich, falowanych brązowych włosach stoi w szarej, kwiecistej sukience bez ramiączek z ozdobami z czarnej wstążki na tle bujnego górskiego pola z białymi dzikimi kwiatami pod pochmurnym niebem.
Szczegółowa ilustracja przystojnego czarnoskórego mężczyzny o ciemnej karnacji w taktycznym ubraniu, noszącego szarą kamizelkę kuloodporną, czarne rękawice, czarną maskę na połowę twarzy, trzymającego dwa pistolety skierowane do przodu na białym tle.