モデル/Stable Cascade - ベース

Stable Cascade - ベース

|
9/20/2025
|
1:05:01 AM
| Discussion
ハニーブロンドの髪とエメラルドの目を持つ女性のリアルなファンタジーポートレート。頬に涙を浮かべながら上を見上げ、銀のイヤリングとネックレスを身に着けています。
黄金時間に街並みと飛行船を背景に、光る魔法の火花と共に風になびく髪の四人のネオヴィクトリアンのヒロインが屋根裏の温室にいる様子。

推奨パラメータ

steps

10 - 20

resolution

1024x1024

ヒント

Stage Cの36億パラメータ版を使用すると、主なファインチューニングが行われているため最良の結果が得られます。

Stage Bでは15億パラメータ版を使用すると、小さく細かいディテールの再現に優れています。

潜在空間が小さいため効率的なトレーニングと推論に適しており、ファインチューニング、LoRA、ControlNet、IP-Adapter、LCMなどの拡張をサポートします。

本モデルは研究目的のみに使用し、事実的表現の生成やStability AIの許容使用ポリシーに違反する用途には使用しないでください。

顔や人物は正しく生成されない場合があり、モデルの自己符号化は損失を伴います。

クリエイタースポンサー

デモ:

Stable Cascade

このモデルはWürstchenアーキテクチャを基に構築されており、Stable Diffusionのような他のモデルとの主な違いははるかに小さい潜在空間で動作することです。

なぜこれが重要なのか?潜在空間が小さいほど、推論が速くなり、トレーニングコストが安くなります。

潜在空間はどれほど小さいのか?Stable Diffusionは圧縮率が8で、1024x1024の画像を128x128にエンコードします。Stable Cascadeは圧縮率42を実現し、1024x1024の画像を24x24に圧縮しつつ鮮明な復元が可能です。テキスト条件付きモデルはこの高度に圧縮された潜在空間でトレーニングされます。以前のこのアーキテクチャバージョンはStable Diffusion 1.5に比べコストを16分の1に削減しました。 <br> <br>

したがって、このモデルは効率性が重要な用途に適しています。さらに、ファインチューニング、LoRA、ControlNet、IP-Adapter、LCMなどの既知の拡張もこの方法で利用可能です。

モデル詳細

モデル説明

Stable Cascadeはテキストプロンプトに基づき画像を生成する拡散モデルです。

  • 開発: Stability AI

  • 資金提供: Stability AI

  • モデルタイプ: テキストから画像生成の生成モデル

モデルソース

研究目的には弊社のStableCascade Githubリポジトリ(https://github.com/Stability-AI/StableCascade)をお勧めします。

モデル概要

Stable Cascadeは3つのモデル、Stage A、Stage B、Stage Cで構成され、カスケード方式で画像を生成するため、この名前が付けられています。

Stage AとBは画像圧縮に用いられ、Stable DiffusionのVAEに相当する役割を果たします。

この構成により、より高い圧縮率が可能です。Stable Diffusionが空間圧縮率8で1024 x 1024を128 x 128へエンコードするのに対し、Stable Cascadeは圧縮率42で1024 x 1024を24 x 24にエンコードし、正確なデコードが可能です。

これによりトレーニングと推論コストが大幅に削減されます。Stage Cはテキストプロンプトに基づいて24 x 24の潜在表現を生成します。以下の画像はこれを視覚的に示しています。

今回のリリースでは、Stage C用に2つ、Stage B用に2つ、Stage A用に1つのチェックポイントを提供します。Stage Cは10億パラメータ版と36億パラメータ版があり、ほとんどのファインチューニングが36億版で行われているため、そちらの使用を強く推奨します。Stage Bは7億と15億パラメータ版があり、どちらも良好な結果を出しますが、15億版は小さい細部の復元に優れています。したがって、それぞれより大きい方のバリアントを使うと最良の結果が得られます。Stage Aは2000万パラメータで小さいため固定されています。

評価

評価によれば、Stable Cascadeはほとんどの比較においてプロンプト適合度と美的品質の両方で最高のパフォーマンスを示します。上の画像は、人間評価による結果で、parti-prompts(リンク)と美的プロンプトの組み合わせで実施されました。具体的には、Stable Cascade(推論ステップ30)がPlayground v2(推論ステップ50)、SDXL(推論ステップ50)、SDXL Turbo(推論ステップ1)、Würstchen v2(推論ステップ30)と比較されました。

コード例

⚠️ 重要: 以下のコードを動作させるには、PRが作業中のこのブランチから diffusersをインストールする必要があります。

pip install git+https://github.com/kashif/diffusers.git@wuerstchen-v3

import torch

from diffusers import StableCascadeDecoderPipeline, StableCascadePriorPipeline

device = "cuda"

num_images_per_prompt = 2

prior = StableCascadePriorPipeline.from_pretrained("stabilityai/stable-cascade-prior", torch_dtype=torch.bfloat16).to(device)

decoder = StableCascadeDecoderPipeline.from_pretrained("stabilityai/stable-cascade", torch_dtype=torch.float16).to(device)

prompt = "Anthropomorphic cat dressed as a pilot"

negative_prompt = ""

prior_output = prior(

prompt=prompt,

height=1024,

width=1024,

negative_prompt=negative_prompt,

guidance_scale=4.0,

num_images_per_prompt=num_images_per_prompt,

num_inference_steps=20

)

decoder_output = decoder(

image_embeddings=prior_output.image_embeddings.half(),

prompt=prompt,

negative_prompt=negative_prompt,

guidance_scale=0.0,

output_type="pil",

num_inference_steps=10

).images

# Now decoder_output is a list with your PIL images

使用例

直接使用

このモデルは今のところ研究目的向けです。可能な研究分野・課題には以下が含まれます。

  • 生成モデルの研究。

  • 有害コンテンツ生成の可能性があるモデルの安全な運用。

  • 生成モデルの制限やバイアスの調査と理解。

  • アートワークの生成およびデザインやその他の芸術的プロセスへの応用。

  • 教育的または創造的なツールでの応用。

除外される用途については下記を参照してください。

対象外の使用

本モデルは人や出来事の事実的または真実の表現を目的としてトレーニングされておらず、

そのようなコンテンツの生成に使用することはモデルの能力の範囲外です。

また、モデルはStability AIの許容使用ポリシーに違反する方法での使用は禁止されています。

制限とバイアス

制限事項

  • 顔や人物は正しく生成されない場合があります。

  • モデルの自己符号化部分は損失を伴います。

推奨事項

本モデルは研究目的のみに使用してください。

モデルの始め方

https://github.com/Stability-AI/StableCascade をご覧ください。

前の画像
Midnight - v5.0
次の画像
フィルムエミュレーション - ハレーション 35mm(控えめ)

モデル詳細

モデルタイプ

Checkpoint

ベースモデル

Stable Cascade

モデルバージョン

base

モデルハッシュ

0d28c8562d

作成者

ディスカッション

コメントを残すには log in してください。

「Stable Cascade - ベース」による画像

ハニーブロンドの髪とエメラルドの目を持つ女性のリアルなファンタジーポートレート。頬に涙を浮かべながら上を見上げ、銀のイヤリングとネックレスを身に着けています。
黄金時間に街並みと飛行船を背景に、光る魔法の火花と共に風になびく髪の四人のネオヴィクトリアンのヒロインが屋根裏の温室にいる様子。

アニメ画像

半分機械の顔、青く光る目、こめかみのバーコードタトゥー、白いひげ、錆びた機械部品を持つ風化したサイボーグのクローズアップ。背景は黒。
長い虹色の髪を持つアニメ風の少女が苔むした丸太の上であぐらをかき、大きな白いオオカミが膝に頭を乗せている様子を優しく撫でている。周囲は古代の霧深い森で光るキノコが生えている。
午前3時の空の地下鉄プラットフォームに裸足で立つセーラー服のアニメ少女。赤い彼岸花を持ち、ホログラフィックのグリッチ効果とちらつく蛍光灯の光がある。
赤いバックパックを背負った若い女性が、明るい青い空に白い雲が浮かぶ中、鮮やかな黄金の草原と起伏のある丘の上にある巨大な工業用リング構造を詳細なアニメスタイルで見つめています。
長いピンク髪の女性の背面、黒いオーバーオールと黒のConverseスニーカーを履いて金属製の手すりに寄りかかり、街灯とボケ効果のある夜の街並みを背景にしている。
ノースリーブのシャツとパンツを着たナルトの綱手のアニメスタイル画像。庭の小道で外に向かって微笑みながら手を伸ばしている。
柔らかなアンビエントライトの下、大きな緑の植物と鮮やかなオレンジの花に囲まれ、鮮やかな楽園の鳥が頭上を飛ぶ豊かなジャングルの川辺で静かに瞑想する女性。
ロボットアームを持つサイバーパンク女性が、木製の床と障子のある伝統的な日本の部屋で盆栽を丁寧に剪定している、アニメスタイルの画像。
成熟した赤鬼の女性、赤い肌と黒い角、顔の一部を覆う青い髪、片目をこすりながら角付きぬいぐるみを抱える、柔らかく詳細な照明の中で。
非常に長い多色の髪を持ち、白い流れるドレスを着た春の女神が、夜明けの蓮の花と植物の中で穏やかに座り、澄んだ青空に鳥が飛んでいます。

アート画像

濃い霧の中、オレンジと青の光に照らされた高層ビルが立ち並び、雲の上に浮かぶ大きな円形の浮遊構造物を中心とした未来的な都市景観。
閉じた目の顔を特徴とするクローズアップの抽象肖像画。三色インクで作成され、爆発的な筆使いとオレンジ、青、赤、黒の飛沫が感情の強さと混沌としたエネルギーを伝えています。
鮮やかな赤い顔、黄色い目、複雑な白黒の模様、羽毛のような毛皮の質感が黒い背景に描かれたマンドリルの頭部の詳細なデジタルイラスト。
夜の雨の中で人の上に迫る赤と黒のドラゴンのスケッチ。
暗い背景に際立つ赤、白、黒の色彩で描かれた水中の金魚の抽象的なアクリル画
ナポレオン時代とサイバーパンクスタイルを融合させたエレガントな金のアクセントが施された海軍制服を着た、ジンジャーヘアと青い目の決意に満ちた軍司令官の肖像。煙が立ち込める都市の要塞に立っています。
そばかすのあるエルフの女性血魔術師の詳細な肖像。スカーレットのフードとローブを身に着け、血のように赤い目と複雑な魔法の紋章が暗い森の洞窟の中で渦巻いている。
ベージュの背景に立つ女性のシルエットの周りに、赤、黄色、青、オレンジ、紫の鮮やかでカラフルなフラクタルのようなペイント飛沫が広がっている様子。
黒いレザーブラレットとハイウエストのワイドパンツを着て自信に満ちた姿で腕を広げて立つスタイリッシュな女性。彼女は長い編み込みの髪を持ち、明るい緑のプラットフォームヒールを履いています。背景は緑色のトーンと影のパターンが特徴です。
コート・ダジュール海岸上の大きな青空に白い雲と飛行機雲が広がる中、南フランス・カップ・カナイユのビーチを歩く細身の女性のシルエットを示すミニマリストのフラットベクター作品。

基本モデル画像

暗く不吉な空の下、光るジャックオーランタンに照らされた不気味な墓地を歩くゾンビや骸骨を含むアンデッドキャラクターの写実的なシーン。

ロゴ画像

オーバーウォッチのD.VAがタイトな青と白のボディスーツを着てひざまずきながらハンドガンを持ち、背景にはピンク調の大きなクローズアップでブラウンの目の顔が描かれているデジタルアート。
ストライプの従業員シャツを着て、インスタントラーメンのカップやさまざまな商品が並ぶショップカウンターの後ろに立つ、大きなイカのようなヒューマノイドキャラクターのイラスト。詳細な線画のハッチングと土色調で描かれています。
スチームパンクスタイルのコーヒーマシンと笑顔の少女、水彩スケッチ。
ブルーアーカイブのちびシロコのピクセルアート。アイソメトリックグリッドで剣を持つ。
燃えるろうそくと果物の超リアルな静物画。

リアリズム画像

A vibrant orange tulip in a rainy forest with raindrops on its petals and leaves. Under one large green leaf, a small chibi kodama wood spirit with large black eyes shelters itself from the rain.
オレンジの背景に大きく湾曲した角とテクスチャードクロスのフードをかぶった動物の頭蓋骨マスクを着用した男性の横顔。フィルムグレイン効果が施されています。
華麗な鎧をまとった戦士が、大きな翼を持つドラゴンのような馬に乗り、激しい炎と燃えさしをかいくぐり、炎の地獄から逃げている。詳細でリアルなファンタジーアートスタイルで描かれている。
濃密な葉に囲まれた青々とした草原のデジタルアートで、木漏れ日が差し込み、小さな白い花が点在している。
黒のノースリーブトップと複雑なメタルカラーを身につけ、窓際で煙を吐く短髪の若者の肖像。
もしゃもしゃの茶色と灰色の毛皮を持ち、ポンポン付きの暗いニットビーニー、汚れた緑色のジャケット、暗いズボン、非常に大きく汚れたスニーカーを履いた擬人化された犬が、ぼやけた都市の建物を背景に濡れた都会の地面に立っている。
流れる赤い髪のファンタジー戦士女性、毛皮のマントと革の鎧を着用し、部族のタトゥーで飾られ剣を持ち、クマのそばに立っている。
バットマンが彼の黒いスーツを着て、冠水した足首までの水に浸った白いプラスチック椅子に座り、豪雨の中でビール瓶を持っている都市の通り。
ドラマチックな暗い背景に黄金のしぶきが散る中、黄金の機械部品とロボットの優雅さを持つ未来的なスチームパンクサイボーグ女性の横顔。