模型/Stable Cascade - 基礎版

Stable Cascade - 基礎版

一幅逼真的奇幻肖像,描繪一名擁有蜂蜜金髮和翡翠眼睛的女性,正向上凝視,臉頰帶有淚痕,佩戴銀色耳環和項鍊。
四位新維多利亞女英雄坐落於陽光充足的閣樓溫室,長髮飛揚且伴有魔法火花,背景為黃金時刻的城市景觀及飛艇。

推薦參數

steps

10 - 20

resolution

1024x1024

提示

使用階段 C 的 36 億參數版本以獲得最佳效果,因主要微調工作基於該版本完成。

階段 B 建議使用 15 億參數版本,能更好地重建細小且精細的細節。

模型因潛在空間較小,適合高效訓練與推理,且支持微調、LoRA、ControlNet、IP-Adapter 和 LCM 等擴展。

該模型僅限於研究用途,禁止用於生成事實性內容或違反 Stability AI 可接受使用政策。

由於模型的自動編碼有損失,面孔和人物生成可能不夠準確。

創作者贊助

演示:

Stable Cascade

此模型基於 Würstchen 架構,與 Stable Diffusion 等其他模型的主要區別在於它在更小的潛在空間中運作。

這點為何重要?潛在空間越小,推理速度越快,且訓練成本越低

潛在空間有多小?Stable Diffusion 使用 8 倍壓縮因子,將 1024x1024 的圖像編碼為 128x128。Stable Cascade 則達到 42 倍壓縮,能將 1024x1024 圖像編碼成 24x24,同時保持清晰的重建效果。該文本條件模型在高度壓縮的潛在空間中進行訓練。該架構的先前版本相較 Stable Diffusion 1.5 實現 16 倍的成本降低。<br> <br>

因此,此類模型非常適合重視效率的使用場景。此外,所有已知擴展如微調、LoRA、ControlNet、IP-Adapter、LCM 等也皆可透過此方法實現。

模型細節

模型描述

Stable Cascade 是一款訓練用以根據文本提示生成圖像的擴散模型。

  • 開發者: Stability AI

  • 資助者: Stability AI

  • 模型類型: 生成文本到圖像模型

模型來源

研究用途推薦訪問我們的 StableCascade Github 倉庫 (https://github.com/Stability-AI/StableCascade)。

模型概述

Stable Cascade 由三個模型組成:階段 A、階段 B 和階段 C,組成生成圖像的級聯,故名“Stable Cascade”。

階段 A 和 B 用於圖像壓縮,類似 Stable Diffusion 中 VAE 的作用。

但該設置能實現更高比例的圖像壓縮。Stable Diffusion 使用 8 倍空間壓縮,將解析度為 1024 x 1024 的圖像編碼為 128 x 128,Stable Cascade 則達到 42 倍壓縮,將 1024 x 1024 編碼為 24 x 24,且能精確解碼圖像。這帶來了訓練和推理成本更低的巨大好處。此外,階段 C 負責根據文本提示生成小尺寸的 24 x 24 潛在向量。以下圖片為該流程的視覺展示。

此次發布提供階段 C 兩個檢查點,階段 B 兩個檢查點和階段 A 一個檢查點。階段 C 有 10 億和 36 億參數版本,強烈建議使用 36 億版本,因大部分微調工作在此版本完成。階段 B 的兩個版本分別為 7 億和 15 億參數,兩者均有優秀表現,但 15 億版本更擅長重建細小細節。因此,使用較大版本可獲得最佳效果。階段 A 由於規模小(2000 萬參數)故為固定模型。

評估

根據我們的評估,Stable Cascade 幾乎在所有比較中,在提示對齊和美學質量方面表現最佳。上述圖片展示了使用混合部分提示(連結)和美學提示的人類評估結果。具體而言,Stable Cascade(30 推理步驟)對比 Playground v2(50 推理步驟)、SDXL(50 推理步驟)、SDXL Turbo(1 推理步驟)以及 Würstchen v2(30 推理步驟)。

代碼示例

⚠️ 注意:為使以下代碼正常運行,你需要安裝當前 PR 正在進行中的 diffusers 分支。

pip install git+https://github.com/kashif/diffusers.git@wuerstchen-v3

import torch

from diffusers import StableCascadeDecoderPipeline, StableCascadePriorPipeline

device = "cuda"

num_images_per_prompt = 2

prior = StableCascadePriorPipeline.from_pretrained("stabilityai/stable-cascade-prior", torch_dtype=torch.bfloat16).to(device)

decoder = StableCascadeDecoderPipeline.from_pretrained("stabilityai/stable-cascade", torch_dtype=torch.float16).to(device)

prompt = "Anthropomorphic cat dressed as a pilot"

negative_prompt = ""

prior_output = prior(

prompt=prompt,

height=1024,

width=1024,

negative_prompt=negative_prompt,

guidance_scale=4.0,

num_images_per_prompt=num_images_per_prompt,

num_inference_steps=20

)

decoder_output = decoder(

image_embeddings=prior_output.image_embeddings.half(),

prompt=prompt,

negative_prompt=negative_prompt,

guidance_scale=0.0,

output_type="pil",

num_inference_steps=10

).images

#現在 decoder_output 是包含你的 PIL 圖像的列表

用途

直接使用

該模型目前主要服務於研究用途。可能的研究領域和任務包括:

  • 生成模型研究。

  • 安全部署具有生成有害內容潛力的模型。

  • 探查並理解生成模型的限制與偏差。

  • 藝術創作生成及設計等藝術過程應用。

  • 教育或創意工具中的應用。

以下描述的用途不在模型適用範圍內。

超出適用範圍的用途

該模型未經訓練用以生成人物或事件的事實性或真實表徵,

因此將其用於生成此類內容不屬於模型能力範圍內。

模型不得用於任何違反 Stability AI 可接受使用政策的方式。

限制與偏差

限制

  • 人物與面孔生成可能不夠準確。

  • 模型的自動編碼部分存在資料損失。

建議

該模型僅用於研究目的。

如何開始使用該模型

詳見 https://github.com/Stability-AI/StableCascade

上一個
Midnight - v5.0
下一個
膠片仿真 - Halation 35mm(微妙)

模型詳情

模型類型

Checkpoint

基礎模型

Stable Cascade

模型版本

base

模型雜湊值

0d28c8562d

創作者

討論

log in以發表評論。

Stable Cascade - 基礎版 的圖片

一幅逼真的奇幻肖像,描繪一名擁有蜂蜜金髮和翡翠眼睛的女性,正向上凝視,臉頰帶有淚痕,佩戴銀色耳環和項鍊。
四位新維多利亞女英雄坐落於陽光充足的閣樓溫室,長髮飛揚且伴有魔法火花,背景為黃金時刻的城市景觀及飛艇。

動畫 圖片

成熟的赤鬼女性,紅色皮膚黑色角,藍髮部分遮臉,一手揉眼一手抱著帶角絨毛玩具,柔和細膩的燈光。
一位春之女神,擁有非常長的多彩髮絲,穿著飄逸白裙,安詳地坐於蓮花與植被間,背景是清澈藍天和飛翔的鳥兒,日出時分。
一名長棕髮女子穿著白色襯衫和黑色格子裙,在晴朗藍天和翱翔鳥群下,走在高懸於雲端之上的狹窄木橋上。
數碼藝術作品,描繪一位長棕髮女性賽博格漂浮於未來主義賽博朋克環境中,身著帶紅色電纜和霓虹藍燈光的分段機械裝甲。
特寫一位擁有白髮和天體液態圖案皮膚的抽象動漫女孩,背景為密集圖案的抽象風格。
數碼插畫描繪一位藍髮女性坐在銹蝕的金屬坦克上,穿著牛仔工裝褲和護目鏡,背景是布滿蓬鬆雲朵的天空。
一位留短髮的女性流浪者赤腳穿過膝蓋深的水,走在一個被生物發光藻類和吊燈照亮的淹水廢棄裝飾藝術風格餐館內。
一個科幻場景,展示一個大型圓形太空港懸浮於沙漠島嶼上方的雲層中,一個穿著未來裝甲服的身影站在岩石地形上觀望。
數碼繪畫,一位長髮黑色頭髮女孩坐在混凝土邊緣,穿著白色襯衫和藍色長褲,沐浴在柔和的自然光中,背景為都市紋理牆面
一個奇幻場景,展示一名擁有長淺棕髮和銳利綠眼的驚恐精靈少女,在黑暗洞穴中手持燃燒的火把,背後有一個眼睛發光的骷髏佇立。

藝術 圖片

未來都市景觀,特色為高聳的摩天大樓,橙藍燈光穿透濃霧,中央為一個大型漂浮於雲端之圓形結構。
特寫抽象肖像,描繪閉眼的面孔,使用三色墨水和爆炸性筆觸繪製,橙色、藍色、紅色及黑色飛濺,傳達情感強度與混沌能量。
高度細緻的Mandrill頭部數碼插畫,面部鮮紅,黃色眼睛,黑白複雜圖案及羽毛毛皮質感,黑色背景。
雨夜中一條紅黑色龍在一個人頭頂上方籠罩的素描畫。
水中金魚抽象壓克力畫,醒目的紅、白、黑色調配以深色背景
一位具有決心的軍事指揮官肖像,擁有薑黃色頭髮和藍色眼睛,穿著優雅且以金色點綴的海軍制服,融合了拿破崙時代與賽博朋克風格,站立於煙霧瀰漫的都市據點中。
一位雀斑精靈女性血魔法師的細緻肖像,她戴著紅色頭巾和長袍,擁有血紅色眼睛和錯綜複雜的魔法符號,在黑暗森林洞穴中盤旋。
一名女人的輪廓站立在米色背景前,周圍有鮮艷多彩的分形狀油漆飛濺,色彩包括紅、黃、藍、橙和紫色。
時尚女性穿著黑色皮革背心和高腰寬褲,自信地站立,雙臂張開。她有長長的編織髮型和亮綠色厚底高跟鞋。背景為綠色調,帶有陰影圖案。
極簡平面矢量藝術,展現一位纖瘦女子剪影在法國南部 Cap Canaille 海灘漫步,背景為滿布白雲與飛機尾跡的藍色天空及蔚藍海岸 Côte d'Azur。

基礎模型 圖片

寫實風不死角色場景,包括殭屍與骷髏穿行於由發光南瓜燈照亮的陰暗、詭譎天空下的恐怖墳場。

logo 圖片

數碼藝術呈現 Overwatch 的 D.VA,穿著貼身藍白色連身衣,單膝跪地持手槍,背景為粉紅色調大特寫她的棕色眼睛面容。
一幅穿著條紋員工衫的大型魷魚樣人形角色插畫,站在擺滿即食麵杯和各種商品的店舖櫃檯後,以詳盡的線性剖面和泥土色調繪製。
蒸汽龐克風格咖啡機與微笑女孩,水彩素描。
Blue Archive中chibi Shiroko的像素藝術,持劍,處於等角格子上。
使用 Stable Diffusion AI 生成的詳細靜物圖像,包含多種水果與燃燒的蠟燭。

寫實主義 圖片

一隻高度細節的擬人化狗狗,擁有蓬鬆的棕色與灰色毛髮,戴著一頂帶有毛球的深色針織毛線帽,穿著骯髒的綠色外套、深色褲子,和超大且髒污的運動鞋,站在濕潤的都市地面,背景為模糊的城市建築。
紅髮飄逸的奇幻女戰士,穿著毛皮披肩和皮革鎧甲,身披部落刺青,手持劍,站立於熊旁。
穿著黑色戰衣的Batman坐在淺及腳踝的水災中白色塑膠椅上,手持啤酒瓶,大雨中站立於城市街道。
未來蒸汽朋克賽博格女性側面輪廓,配有黃金機械零件和機械優雅,背景為戲劇性暗色調搭配黃金濺射。
一名有雀斑、灰綠色眼睛的紅髮少女俯身於木桌前,餵養玻璃魚缸中的鬥魚,穿著綠色絲綢袍,場景為昏暗公寓,使用電影燈光。
逼真女性機械人側面圖,帶有詳細機械部件,背景為純紫色。
一位時尚年輕韓國女子,擁有深色不對稱肩長髮和紅唇,穿著帶金色幾何圖案的白色露肩裙,配戴橙色染色眼鏡,背後有橙色螺旋光環,背景為深青綠色。
一位年輕女子擁有長且波浪狀的棕色頭髮,穿著無肩帶灰色花卉裙,裙上帶有黑色緞帶裝飾,站在滿是白色野花的翠綠山區田野,天空多雲。
一幅超細節插圖,描繪一位穿著戰術裝備的英俊黑皮膚男子,戴著灰色護甲背心、黑色手套及黑色半面罩,手持兩把槍向前指,背景為白色。