模型/Stable Cascade - 基礎版

Stable Cascade - 基礎版

一幅逼真的奇幻肖像,描繪一名擁有蜂蜜金髮和翡翠眼睛的女性,正向上凝視,臉頰帶有淚痕,佩戴銀色耳環和項鍊。
四位新維多利亞女英雄坐落於陽光充足的閣樓溫室,長髮飛揚且伴有魔法火花,背景為黃金時刻的城市景觀及飛艇。

推薦參數

steps

10 - 20

resolution

1024x1024

提示

使用階段 C 的 36 億參數版本以獲得最佳效果,因主要微調工作基於該版本完成。

階段 B 建議使用 15 億參數版本,能更好地重建細小且精細的細節。

模型因潛在空間較小,適合高效訓練與推理,且支持微調、LoRA、ControlNet、IP-Adapter 和 LCM 等擴展。

該模型僅限於研究用途,禁止用於生成事實性內容或違反 Stability AI 可接受使用政策。

由於模型的自動編碼有損失,面孔和人物生成可能不夠準確。

創作者贊助

演示:

Stable Cascade

此模型基於 Würstchen 架構,與 Stable Diffusion 等其他模型的主要區別在於它在更小的潛在空間中運作。

這點為何重要?潛在空間越小,推理速度越快,且訓練成本越低

潛在空間有多小?Stable Diffusion 使用 8 倍壓縮因子,將 1024x1024 的圖像編碼為 128x128。Stable Cascade 則達到 42 倍壓縮,能將 1024x1024 圖像編碼成 24x24,同時保持清晰的重建效果。該文本條件模型在高度壓縮的潛在空間中進行訓練。該架構的先前版本相較 Stable Diffusion 1.5 實現 16 倍的成本降低。<br> <br>

因此,此類模型非常適合重視效率的使用場景。此外,所有已知擴展如微調、LoRA、ControlNet、IP-Adapter、LCM 等也皆可透過此方法實現。

模型細節

模型描述

Stable Cascade 是一款訓練用以根據文本提示生成圖像的擴散模型。

  • 開發者: Stability AI

  • 資助者: Stability AI

  • 模型類型: 生成文本到圖像模型

模型來源

研究用途推薦訪問我們的 StableCascade Github 倉庫 (https://github.com/Stability-AI/StableCascade)。

模型概述

Stable Cascade 由三個模型組成:階段 A、階段 B 和階段 C,組成生成圖像的級聯,故名“Stable Cascade”。

階段 A 和 B 用於圖像壓縮,類似 Stable Diffusion 中 VAE 的作用。

但該設置能實現更高比例的圖像壓縮。Stable Diffusion 使用 8 倍空間壓縮,將解析度為 1024 x 1024 的圖像編碼為 128 x 128,Stable Cascade 則達到 42 倍壓縮,將 1024 x 1024 編碼為 24 x 24,且能精確解碼圖像。這帶來了訓練和推理成本更低的巨大好處。此外,階段 C 負責根據文本提示生成小尺寸的 24 x 24 潛在向量。以下圖片為該流程的視覺展示。

此次發布提供階段 C 兩個檢查點,階段 B 兩個檢查點和階段 A 一個檢查點。階段 C 有 10 億和 36 億參數版本,強烈建議使用 36 億版本,因大部分微調工作在此版本完成。階段 B 的兩個版本分別為 7 億和 15 億參數,兩者均有優秀表現,但 15 億版本更擅長重建細小細節。因此,使用較大版本可獲得最佳效果。階段 A 由於規模小(2000 萬參數)故為固定模型。

評估

根據我們的評估,Stable Cascade 幾乎在所有比較中,在提示對齊和美學質量方面表現最佳。上述圖片展示了使用混合部分提示(連結)和美學提示的人類評估結果。具體而言,Stable Cascade(30 推理步驟)對比 Playground v2(50 推理步驟)、SDXL(50 推理步驟)、SDXL Turbo(1 推理步驟)以及 Würstchen v2(30 推理步驟)。

代碼示例

⚠️ 注意:為使以下代碼正常運行,你需要安裝當前 PR 正在進行中的 diffusers 分支。

pip install git+https://github.com/kashif/diffusers.git@wuerstchen-v3

import torch

from diffusers import StableCascadeDecoderPipeline, StableCascadePriorPipeline

device = "cuda"

num_images_per_prompt = 2

prior = StableCascadePriorPipeline.from_pretrained("stabilityai/stable-cascade-prior", torch_dtype=torch.bfloat16).to(device)

decoder = StableCascadeDecoderPipeline.from_pretrained("stabilityai/stable-cascade", torch_dtype=torch.float16).to(device)

prompt = "Anthropomorphic cat dressed as a pilot"

negative_prompt = ""

prior_output = prior(

prompt=prompt,

height=1024,

width=1024,

negative_prompt=negative_prompt,

guidance_scale=4.0,

num_images_per_prompt=num_images_per_prompt,

num_inference_steps=20

)

decoder_output = decoder(

image_embeddings=prior_output.image_embeddings.half(),

prompt=prompt,

negative_prompt=negative_prompt,

guidance_scale=0.0,

output_type="pil",

num_inference_steps=10

).images

#現在 decoder_output 是包含你的 PIL 圖像的列表

用途

直接使用

該模型目前主要服務於研究用途。可能的研究領域和任務包括:

  • 生成模型研究。

  • 安全部署具有生成有害內容潛力的模型。

  • 探查並理解生成模型的限制與偏差。

  • 藝術創作生成及設計等藝術過程應用。

  • 教育或創意工具中的應用。

以下描述的用途不在模型適用範圍內。

超出適用範圍的用途

該模型未經訓練用以生成人物或事件的事實性或真實表徵,

因此將其用於生成此類內容不屬於模型能力範圍內。

模型不得用於任何違反 Stability AI 可接受使用政策的方式。

限制與偏差

限制

  • 人物與面孔生成可能不夠準確。

  • 模型的自動編碼部分存在資料損失。

建議

該模型僅用於研究目的。

如何開始使用該模型

詳見 https://github.com/Stability-AI/StableCascade

上一個
Midnight - v5.0
下一個
膠片仿真 - Halation 35mm(微妙)

模型詳情

模型類型

Checkpoint

基礎模型

Stable Cascade

模型版本

base

模型雜湊值

0d28c8562d

創作者

討論

log in以發表評論。

Stable Cascade - 基礎版 的圖片

一幅逼真的奇幻肖像,描繪一名擁有蜂蜜金髮和翡翠眼睛的女性,正向上凝視,臉頰帶有淚痕,佩戴銀色耳環和項鍊。
四位新維多利亞女英雄坐落於陽光充足的閣樓溫室,長髮飛揚且伴有魔法火花,背景為黃金時刻的城市景觀及飛艇。

動畫 圖片

穿黑色和服配白色腰帶、藍色眼睛、編織馬尾的成熟女性,雙手叉腰在室外藍天下微笑。
一幅細緻的動漫少女數碼畫,擁有金色頭髮和引人注目的藍色眼睛,以柔和夢幻的光線呈現 CGI 風格。
Dio Brando 金髮綠色頭帶特寫肖像,周圍環繞閃爍效果,背景為明亮藍天。
一間散發紫羅蘭色霓虹燈光的賽博朋克酒吧,充滿戴著頭盔及賽博裝備的未來派顧客,設有全息屏幕及高科技氛圍。
黃昏時分,一名金髮動漫少女穿著白色與紅色衣服,走過被橙色發光水母包圍的森林溪流,畫面細膩。
一位白長雙馬尾、藍眼、尖耳的精靈少女肖像,穿著帶金邊飾品的白色斗篷,背景為黑色。
動漫風格的精靈女孩,銀白色長雙馬尾與綠色眼睛,站立於藍色花田中,身穿白色披肩、條紋襯衫及黑色絲襪。
一位擁有藍色眼睛和棕色頭髮的年輕動漫女性站在具有夢境美學的鈷藍色馬賽克花卉背景前。
動漫風格數碼插畫展示一座大型尖頂三角形石金字塔結構,矗立在散布岩石的貧瘠土地上,背景是繁星點點的天空和帶橙色環的行星。
細緻動漫風女性戰士穿著黑色皮革服裝,擺出動感姿勢,背景有藍橙色繽紛旋渦效果。

藝術 圖片

未來都市景觀,特色為高聳的摩天大樓,橙藍燈光穿透濃霧,中央為一個大型漂浮於雲端之圓形結構。
特寫抽象肖像,描繪閉眼的面孔,使用三色墨水和爆炸性筆觸繪製,橙色、藍色、紅色及黑色飛濺,傳達情感強度與混沌能量。
高度細緻的Mandrill頭部數碼插畫,面部鮮紅,黃色眼睛,黑白複雜圖案及羽毛毛皮質感,黑色背景。
雨夜中一條紅黑色龍在一個人頭頂上方籠罩的素描畫。
水中金魚抽象壓克力畫,醒目的紅、白、黑色調配以深色背景
一位具有決心的軍事指揮官肖像,擁有薑黃色頭髮和藍色眼睛,穿著優雅且以金色點綴的海軍制服,融合了拿破崙時代與賽博朋克風格,站立於煙霧瀰漫的都市據點中。
一位雀斑精靈女性血魔法師的細緻肖像,她戴著紅色頭巾和長袍,擁有血紅色眼睛和錯綜複雜的魔法符號,在黑暗森林洞穴中盤旋。
一名女人的輪廓站立在米色背景前,周圍有鮮艷多彩的分形狀油漆飛濺,色彩包括紅、黃、藍、橙和紫色。
時尚女性穿著黑色皮革背心和高腰寬褲,自信地站立,雙臂張開。她有長長的編織髮型和亮綠色厚底高跟鞋。背景為綠色調,帶有陰影圖案。
極簡平面矢量藝術,展現一位纖瘦女子剪影在法國南部 Cap Canaille 海灘漫步,背景為滿布白雲與飛機尾跡的藍色天空及蔚藍海岸 Côte d'Azur。

基礎模型 圖片

寫實風不死角色場景,包括殭屍與骷髏穿行於由發光南瓜燈照亮的陰暗、詭譎天空下的恐怖墳場。

logo 圖片

一幅穿著條紋員工衫的大型魷魚樣人形角色插畫,站在擺滿即食麵杯和各種商品的店舖櫃檯後,以詳盡的線性剖面和泥土色調繪製。
蒸汽龐克風格咖啡機與微笑女孩,水彩素描。
Blue Archive中chibi Shiroko的像素藝術,持劍,處於等角格子上。
使用 Stable Diffusion AI 生成的詳細靜物圖像,包含多種水果與燃燒的蠟燭。

寫實主義 圖片

Cyberpunk female cyborg with white hair and oni horns holding a katana against a vivid yellow background, featuring mechanical arms and futuristic armor.
Traditional New York brownstone entrance featuring double arched wooden doors, warm hanging lantern lighting, white columns, and potted plants on stone steps.
A pan pizza topped with pan roasted cajun shrimp, sausage slices, red and yellow bell peppers, green onions, melted cheese, and seasoning.
A watercolor portrait of a young woman with tousled blonde hair and large black-framed sunglasses, set against an earthy beige background with subtle brushstroke textures and splatters.
一輛蘇聯坦克在多雲天空下駛過泥濘的戰壕,從低角度於戰場環境中觀看。
傳統客廳設有落地窗,可俯瞰白雪覆蓋的莫斯科公園及斯大林主義公寓建築。特色包括紅木地板、沙發、咖啡桌、地毯及壁爐。
穿牛仔短褲和白色背心的男子在郊區庭院推草機,喝著罐裝啤酒,白色籬笆,美國國旗迎風飄揚,黃金獵犬追逐球。
發光著金色符文的魔戒安置於細緻的中土世界奇幻地圖上,受到戲劇性電影燈光照亮,周圍環繞著迷你樹木的陰影。
傍晚時分的舊村景象,擁有傳統茅草屋頂的房屋和映照在平靜河面的戲劇性雲彩。