モデル/Stable Cascade - ベース

Stable Cascade - ベース

|
9/20/2025
|
1:05:01 AM
| Discussion
ハニーブロンドの髪とエメラルドの目を持つ女性のリアルなファンタジーポートレート。頬に涙を浮かべながら上を見上げ、銀のイヤリングとネックレスを身に着けています。
黄金時間に街並みと飛行船を背景に、光る魔法の火花と共に風になびく髪の四人のネオヴィクトリアンのヒロインが屋根裏の温室にいる様子。

推奨パラメータ

steps

10 - 20

resolution

1024x1024

ヒント

Stage Cの36億パラメータ版を使用すると、主なファインチューニングが行われているため最良の結果が得られます。

Stage Bでは15億パラメータ版を使用すると、小さく細かいディテールの再現に優れています。

潜在空間が小さいため効率的なトレーニングと推論に適しており、ファインチューニング、LoRA、ControlNet、IP-Adapter、LCMなどの拡張をサポートします。

本モデルは研究目的のみに使用し、事実的表現の生成やStability AIの許容使用ポリシーに違反する用途には使用しないでください。

顔や人物は正しく生成されない場合があり、モデルの自己符号化は損失を伴います。

クリエイタースポンサー

デモ:

Stable Cascade

このモデルはWürstchenアーキテクチャを基に構築されており、Stable Diffusionのような他のモデルとの主な違いははるかに小さい潜在空間で動作することです。

なぜこれが重要なのか?潜在空間が小さいほど、推論が速くなり、トレーニングコストが安くなります。

潜在空間はどれほど小さいのか?Stable Diffusionは圧縮率が8で、1024x1024の画像を128x128にエンコードします。Stable Cascadeは圧縮率42を実現し、1024x1024の画像を24x24に圧縮しつつ鮮明な復元が可能です。テキスト条件付きモデルはこの高度に圧縮された潜在空間でトレーニングされます。以前のこのアーキテクチャバージョンはStable Diffusion 1.5に比べコストを16分の1に削減しました。 <br> <br>

したがって、このモデルは効率性が重要な用途に適しています。さらに、ファインチューニング、LoRA、ControlNet、IP-Adapter、LCMなどの既知の拡張もこの方法で利用可能です。

モデル詳細

モデル説明

Stable Cascadeはテキストプロンプトに基づき画像を生成する拡散モデルです。

  • 開発: Stability AI

  • 資金提供: Stability AI

  • モデルタイプ: テキストから画像生成の生成モデル

モデルソース

研究目的には弊社のStableCascade Githubリポジトリ(https://github.com/Stability-AI/StableCascade)をお勧めします。

モデル概要

Stable Cascadeは3つのモデル、Stage A、Stage B、Stage Cで構成され、カスケード方式で画像を生成するため、この名前が付けられています。

Stage AとBは画像圧縮に用いられ、Stable DiffusionのVAEに相当する役割を果たします。

この構成により、より高い圧縮率が可能です。Stable Diffusionが空間圧縮率8で1024 x 1024を128 x 128へエンコードするのに対し、Stable Cascadeは圧縮率42で1024 x 1024を24 x 24にエンコードし、正確なデコードが可能です。

これによりトレーニングと推論コストが大幅に削減されます。Stage Cはテキストプロンプトに基づいて24 x 24の潜在表現を生成します。以下の画像はこれを視覚的に示しています。

今回のリリースでは、Stage C用に2つ、Stage B用に2つ、Stage A用に1つのチェックポイントを提供します。Stage Cは10億パラメータ版と36億パラメータ版があり、ほとんどのファインチューニングが36億版で行われているため、そちらの使用を強く推奨します。Stage Bは7億と15億パラメータ版があり、どちらも良好な結果を出しますが、15億版は小さい細部の復元に優れています。したがって、それぞれより大きい方のバリアントを使うと最良の結果が得られます。Stage Aは2000万パラメータで小さいため固定されています。

評価

評価によれば、Stable Cascadeはほとんどの比較においてプロンプト適合度と美的品質の両方で最高のパフォーマンスを示します。上の画像は、人間評価による結果で、parti-prompts(リンク)と美的プロンプトの組み合わせで実施されました。具体的には、Stable Cascade(推論ステップ30)がPlayground v2(推論ステップ50)、SDXL(推論ステップ50)、SDXL Turbo(推論ステップ1)、Würstchen v2(推論ステップ30)と比較されました。

コード例

⚠️ 重要: 以下のコードを動作させるには、PRが作業中のこのブランチから diffusersをインストールする必要があります。

pip install git+https://github.com/kashif/diffusers.git@wuerstchen-v3

import torch

from diffusers import StableCascadeDecoderPipeline, StableCascadePriorPipeline

device = "cuda"

num_images_per_prompt = 2

prior = StableCascadePriorPipeline.from_pretrained("stabilityai/stable-cascade-prior", torch_dtype=torch.bfloat16).to(device)

decoder = StableCascadeDecoderPipeline.from_pretrained("stabilityai/stable-cascade", torch_dtype=torch.float16).to(device)

prompt = "Anthropomorphic cat dressed as a pilot"

negative_prompt = ""

prior_output = prior(

prompt=prompt,

height=1024,

width=1024,

negative_prompt=negative_prompt,

guidance_scale=4.0,

num_images_per_prompt=num_images_per_prompt,

num_inference_steps=20

)

decoder_output = decoder(

image_embeddings=prior_output.image_embeddings.half(),

prompt=prompt,

negative_prompt=negative_prompt,

guidance_scale=0.0,

output_type="pil",

num_inference_steps=10

).images

# Now decoder_output is a list with your PIL images

使用例

直接使用

このモデルは今のところ研究目的向けです。可能な研究分野・課題には以下が含まれます。

  • 生成モデルの研究。

  • 有害コンテンツ生成の可能性があるモデルの安全な運用。

  • 生成モデルの制限やバイアスの調査と理解。

  • アートワークの生成およびデザインやその他の芸術的プロセスへの応用。

  • 教育的または創造的なツールでの応用。

除外される用途については下記を参照してください。

対象外の使用

本モデルは人や出来事の事実的または真実の表現を目的としてトレーニングされておらず、

そのようなコンテンツの生成に使用することはモデルの能力の範囲外です。

また、モデルはStability AIの許容使用ポリシーに違反する方法での使用は禁止されています。

制限とバイアス

制限事項

  • 顔や人物は正しく生成されない場合があります。

  • モデルの自己符号化部分は損失を伴います。

推奨事項

本モデルは研究目的のみに使用してください。

モデルの始め方

https://github.com/Stability-AI/StableCascade をご覧ください。

前の画像
Midnight - v5.0
次の画像
フィルムエミュレーション - ハレーション 35mm(控えめ)

モデル詳細

モデルタイプ

Checkpoint

ベースモデル

Stable Cascade

モデルバージョン

base

モデルハッシュ

0d28c8562d

作成者

ディスカッション

コメントを残すには log in してください。

「Stable Cascade - ベース」による画像

ハニーブロンドの髪とエメラルドの目を持つ女性のリアルなファンタジーポートレート。頬に涙を浮かべながら上を見上げ、銀のイヤリングとネックレスを身に着けています。
黄金時間に街並みと飛行船を背景に、光る魔法の火花と共に風になびく髪の四人のネオヴィクトリアンのヒロインが屋根裏の温室にいる様子。

アニメ画像

詳細な赤い花が、黒と金の葉と共に星座、渦巻く金と黒の模様、光の粒子がある宇宙的な抽象背景と調和している。
アニメスタイルの若い女性が、鮮やかなピンクと青の色調でデジタルグリッチアートにより断片化されたネオンライトの街路に立っています。
ピンクの武道着を着たToadetteキャラクターが、決意に満ちた表情でキノコの森の大きなキノコの上で裸足でダイナミックな戦闘姿勢をとっています。
東京喰種の霧嶋董香が紫の髪と赤い目で床に横たわり、白い背景に鮮やかな赤い彼岸花と血の染みが囲んでいる。
ネオンジェネシスエヴァンゲリオンのアスカ・ラングレーのアニメスタイルイラスト。オレンジ色の多重に結ばれた髪と青い目を持ち、笑顔で床に座り、部分的にファスナーが開いた赤いボディースーツを着てひび割れた灰色のサイバネティックな壁の前にいる。
ショートピンクの髪と異色症の目を持つ若い女性のクローズアップデジタルポートレート。白と金の未来的なヘルメットを着用し、単色のピンク背景に配置。
サイバーパンク風で、大きな月と霧の背景を背にし、輝く灯台へと歩く一人の人物のシルエットが濡れた桟橋の上にある。
後光と大きな白い翼を持つ黄色い髪の天使の少女が、星空の下でエレキギターを弾き、光る音符が上方に浮かんでいる。
半分機械の顔、青く光る目、こめかみのバーコードタトゥー、白いひげ、錆びた機械部品を持つ風化したサイボーグのクローズアップ。背景は黒。
長い虹色の髪を持つアニメ風の少女が苔むした丸太の上であぐらをかき、大きな白いオオカミが膝に頭を乗せている様子を優しく撫でている。周囲は古代の霧深い森で光るキノコが生えている。

アート画像

白髪で青い目を持つエルフの女性のセミリアリスティックな水彩イラスト。ぴったりとした白い衣服と金色の点で飾られた青いマントを着ており、飛ぶ白い鳩に囲まれています。
濃い霧の中、オレンジと青の光に照らされた高層ビルが立ち並び、雲の上に浮かぶ大きな円形の浮遊構造物を中心とした未来的な都市景観。
閉じた目の顔を特徴とするクローズアップの抽象肖像画。三色インクで作成され、爆発的な筆使いとオレンジ、青、赤、黒の飛沫が感情の強さと混沌としたエネルギーを伝えています。
鮮やかな赤い顔、黄色い目、複雑な白黒の模様、羽毛のような毛皮の質感が黒い背景に描かれたマンドリルの頭部の詳細なデジタルイラスト。
夜の雨の中で人の上に迫る赤と黒のドラゴンのスケッチ。
暗い背景に際立つ赤、白、黒の色彩で描かれた水中の金魚の抽象的なアクリル画
ナポレオン時代とサイバーパンクスタイルを融合させたエレガントな金のアクセントが施された海軍制服を着た、ジンジャーヘアと青い目の決意に満ちた軍司令官の肖像。煙が立ち込める都市の要塞に立っています。
そばかすのあるエルフの女性血魔術師の詳細な肖像。スカーレットのフードとローブを身に着け、血のように赤い目と複雑な魔法の紋章が暗い森の洞窟の中で渦巻いている。
ベージュの背景に立つ女性のシルエットの周りに、赤、黄色、青、オレンジ、紫の鮮やかでカラフルなフラクタルのようなペイント飛沫が広がっている様子。
黒いレザーブラレットとハイウエストのワイドパンツを着て自信に満ちた姿で腕を広げて立つスタイリッシュな女性。彼女は長い編み込みの髪を持ち、明るい緑のプラットフォームヒールを履いています。背景は緑色のトーンと影のパターンが特徴です。

基本モデル画像

暗く不吉な空の下、光るジャックオーランタンに照らされた不気味な墓地を歩くゾンビや骸骨を含むアンデッドキャラクターの写実的なシーン。

ロゴ画像

オーバーウォッチのD.VAがタイトな青と白のボディスーツを着てひざまずきながらハンドガンを持ち、背景にはピンク調の大きなクローズアップでブラウンの目の顔が描かれているデジタルアート。
ストライプの従業員シャツを着て、インスタントラーメンのカップやさまざまな商品が並ぶショップカウンターの後ろに立つ、大きなイカのようなヒューマノイドキャラクターのイラスト。詳細な線画のハッチングと土色調で描かれています。
スチームパンクスタイルのコーヒーマシンと笑顔の少女、水彩スケッチ。
ブルーアーカイブのちびシロコのピクセルアート。アイソメトリックグリッドで剣を持つ。
燃えるろうそくと果物の超リアルな静物画。

リアリズム画像

鮮やかな青空の下、ふわふわのピンクの雲が浮かぶ豊かなラベンダー畑。ミツバチが飛び交い採餌し、詳細な葉や遠くに広がるプロヴァンスの風景。
霧と雲に包まれた岩だらけの山道を歩く孤独な人物。そびえ立つ尖った山頂と神秘的で夢のような雰囲気が特徴。
詳細なファンタジー寝室で、反対の壁から光る目と鋭い牙を持つ巨大なモンスターの顔が脅かすように現れ、ベッドで叫んでいる少女の超リアルなデジタルペインティング。
背中に儀式の庭園が広がる大型の青緑色のサウロポッド恐竜を詳細かつ超リアルに描いた油絵。庭園には小さな爬虫類の僧侶が神聖な植物や苔の中で手入れをしており、パステル調の空と浮遊する胞子の下にあります。
ひび割れた石の鎧にツタが絡まったダイノウォーロックが、血赤い月の下、砕けたモノリスに囲まれた岩の地面に立ち、発光する琥珀色のドクロの杖を持っている。
活気ある鯉で満たされた平和な日本の池、大きな桜の木に囲まれ花びらが舞い落ちる。手描きのちび侍パンダが池の端の岩に座り瞑想し、リアリズムと不思議なアートが融合している。
都市の抗議で高層ビルに囲まれた街路で、盾を持ち防護服を着た暴動鎮圧警察が濃い黒煙をあげる火に直面している。
白いセラミックスキン、詳細な金属製の鎧、赤く光る縫い目を持つサイバネティックアンドロイド女性のクローズアップポートレート。穏やかな表情で上を見上げている。
リアルなサイバーパンクスタイルで、白いセラミックスキン、赤く光る縫い目、緑色の目、そして流れるような黒髪を持つサイバネティック女性アンドロイドのクローズアップ肖像。
雨の森で鮮やかなオレンジのチューリップが、花びらと葉に雨滴をのせています。大きな緑の葉の下には、大きな黒い目を持つ小さなちびこだまの木霊が雨を避けています。