モデル/Stable Cascade - ベース

Stable Cascade - ベース

|
9/20/2025
|
1:05:01 AM
| Discussion
ハニーブロンドの髪とエメラルドの目を持つ女性のリアルなファンタジーポートレート。頬に涙を浮かべながら上を見上げ、銀のイヤリングとネックレスを身に着けています。
黄金時間に街並みと飛行船を背景に、光る魔法の火花と共に風になびく髪の四人のネオヴィクトリアンのヒロインが屋根裏の温室にいる様子。

推奨パラメータ

steps

10 - 20

resolution

1024x1024

ヒント

Stage Cの36億パラメータ版を使用すると、主なファインチューニングが行われているため最良の結果が得られます。

Stage Bでは15億パラメータ版を使用すると、小さく細かいディテールの再現に優れています。

潜在空間が小さいため効率的なトレーニングと推論に適しており、ファインチューニング、LoRA、ControlNet、IP-Adapter、LCMなどの拡張をサポートします。

本モデルは研究目的のみに使用し、事実的表現の生成やStability AIの許容使用ポリシーに違反する用途には使用しないでください。

顔や人物は正しく生成されない場合があり、モデルの自己符号化は損失を伴います。

クリエイタースポンサー

デモ:

Stable Cascade

このモデルはWürstchenアーキテクチャを基に構築されており、Stable Diffusionのような他のモデルとの主な違いははるかに小さい潜在空間で動作することです。

なぜこれが重要なのか?潜在空間が小さいほど、推論が速くなり、トレーニングコストが安くなります。

潜在空間はどれほど小さいのか?Stable Diffusionは圧縮率が8で、1024x1024の画像を128x128にエンコードします。Stable Cascadeは圧縮率42を実現し、1024x1024の画像を24x24に圧縮しつつ鮮明な復元が可能です。テキスト条件付きモデルはこの高度に圧縮された潜在空間でトレーニングされます。以前のこのアーキテクチャバージョンはStable Diffusion 1.5に比べコストを16分の1に削減しました。 <br> <br>

したがって、このモデルは効率性が重要な用途に適しています。さらに、ファインチューニング、LoRA、ControlNet、IP-Adapter、LCMなどの既知の拡張もこの方法で利用可能です。

モデル詳細

モデル説明

Stable Cascadeはテキストプロンプトに基づき画像を生成する拡散モデルです。

  • 開発: Stability AI

  • 資金提供: Stability AI

  • モデルタイプ: テキストから画像生成の生成モデル

モデルソース

研究目的には弊社のStableCascade Githubリポジトリ(https://github.com/Stability-AI/StableCascade)をお勧めします。

モデル概要

Stable Cascadeは3つのモデル、Stage A、Stage B、Stage Cで構成され、カスケード方式で画像を生成するため、この名前が付けられています。

Stage AとBは画像圧縮に用いられ、Stable DiffusionのVAEに相当する役割を果たします。

この構成により、より高い圧縮率が可能です。Stable Diffusionが空間圧縮率8で1024 x 1024を128 x 128へエンコードするのに対し、Stable Cascadeは圧縮率42で1024 x 1024を24 x 24にエンコードし、正確なデコードが可能です。

これによりトレーニングと推論コストが大幅に削減されます。Stage Cはテキストプロンプトに基づいて24 x 24の潜在表現を生成します。以下の画像はこれを視覚的に示しています。

今回のリリースでは、Stage C用に2つ、Stage B用に2つ、Stage A用に1つのチェックポイントを提供します。Stage Cは10億パラメータ版と36億パラメータ版があり、ほとんどのファインチューニングが36億版で行われているため、そちらの使用を強く推奨します。Stage Bは7億と15億パラメータ版があり、どちらも良好な結果を出しますが、15億版は小さい細部の復元に優れています。したがって、それぞれより大きい方のバリアントを使うと最良の結果が得られます。Stage Aは2000万パラメータで小さいため固定されています。

評価

評価によれば、Stable Cascadeはほとんどの比較においてプロンプト適合度と美的品質の両方で最高のパフォーマンスを示します。上の画像は、人間評価による結果で、parti-prompts(リンク)と美的プロンプトの組み合わせで実施されました。具体的には、Stable Cascade(推論ステップ30)がPlayground v2(推論ステップ50)、SDXL(推論ステップ50)、SDXL Turbo(推論ステップ1)、Würstchen v2(推論ステップ30)と比較されました。

コード例

⚠️ 重要: 以下のコードを動作させるには、PRが作業中のこのブランチから diffusersをインストールする必要があります。

pip install git+https://github.com/kashif/diffusers.git@wuerstchen-v3

import torch

from diffusers import StableCascadeDecoderPipeline, StableCascadePriorPipeline

device = "cuda"

num_images_per_prompt = 2

prior = StableCascadePriorPipeline.from_pretrained("stabilityai/stable-cascade-prior", torch_dtype=torch.bfloat16).to(device)

decoder = StableCascadeDecoderPipeline.from_pretrained("stabilityai/stable-cascade", torch_dtype=torch.float16).to(device)

prompt = "Anthropomorphic cat dressed as a pilot"

negative_prompt = ""

prior_output = prior(

prompt=prompt,

height=1024,

width=1024,

negative_prompt=negative_prompt,

guidance_scale=4.0,

num_images_per_prompt=num_images_per_prompt,

num_inference_steps=20

)

decoder_output = decoder(

image_embeddings=prior_output.image_embeddings.half(),

prompt=prompt,

negative_prompt=negative_prompt,

guidance_scale=0.0,

output_type="pil",

num_inference_steps=10

).images

# Now decoder_output is a list with your PIL images

使用例

直接使用

このモデルは今のところ研究目的向けです。可能な研究分野・課題には以下が含まれます。

  • 生成モデルの研究。

  • 有害コンテンツ生成の可能性があるモデルの安全な運用。

  • 生成モデルの制限やバイアスの調査と理解。

  • アートワークの生成およびデザインやその他の芸術的プロセスへの応用。

  • 教育的または創造的なツールでの応用。

除外される用途については下記を参照してください。

対象外の使用

本モデルは人や出来事の事実的または真実の表現を目的としてトレーニングされておらず、

そのようなコンテンツの生成に使用することはモデルの能力の範囲外です。

また、モデルはStability AIの許容使用ポリシーに違反する方法での使用は禁止されています。

制限とバイアス

制限事項

  • 顔や人物は正しく生成されない場合があります。

  • モデルの自己符号化部分は損失を伴います。

推奨事項

本モデルは研究目的のみに使用してください。

モデルの始め方

https://github.com/Stability-AI/StableCascade をご覧ください。

前の画像
Midnight - v5.0
次の画像
フィルムエミュレーション - ハレーション 35mm(控えめ)

モデル詳細

モデルタイプ

Checkpoint

ベースモデル

Stable Cascade

モデルバージョン

base

モデルハッシュ

0d28c8562d

作成者

ディスカッション

コメントを残すには log in してください。

「Stable Cascade - ベース」による画像

ハニーブロンドの髪とエメラルドの目を持つ女性のリアルなファンタジーポートレート。頬に涙を浮かべながら上を見上げ、銀のイヤリングとネックレスを身に着けています。
黄金時間に街並みと飛行船を背景に、光る魔法の火花と共に風になびく髪の四人のネオヴィクトリアンのヒロインが屋根裏の温室にいる様子。

アニメ画像

ロボットアームを持つサイバーパンク女性が、木製の床と障子のある伝統的な日本の部屋で盆栽を丁寧に剪定している、アニメスタイルの画像。
成熟した赤鬼の女性、赤い肌と黒い角、顔の一部を覆う青い髪、片目をこすりながら角付きぬいぐるみを抱える、柔らかく詳細な照明の中で。
非常に長い多色の髪を持ち、白い流れるドレスを着た春の女神が、夜明けの蓮の花と植物の中で穏やかに座り、澄んだ青空に鳥が飛んでいます。
長い茶色の髪を持ち、白いブラウスと黒のチェック柄スカートを着た女性が、青空に舞う鳥たちの下、高く雲の上にかかる細い木製の橋を歩いている。
赤いケーブルとネオンブルーの照明が施された分割型ロボットスーツを着用し、未来的なサイバーパンク環境に浮かぶ長い茶色の髪の女性サイボーグのデジタルアートワーク。
白い髪と肌に天体の液体のような模様が施された抽象的なアニメ少女のクローズアップで、密に模様付けされた抽象的な背景が広がっている。
デニムのオーバーオールとゴーグルを着用し、ふわふわの雲が広がる空を背景に錆びた金属製戦車に座る青髪の女性のデジタルイラスト。
短髪の女性の放浪者が、生物発光藻と吊り下げライトに照らされた膝まで浸かった水の中を裸足で歩く、浸水した放棄されたアールデコ調ダイナー。
未来的な装甲スーツを着た人物が岩の多い地形に立ち、その上空に大きな円形の宇宙港が砂漠の島の雲の上に浮かんでいるSFシーン。
白いシャツと青いズボンを着て柔らかな自然光に包まれ、長い暗い髪の少女がコンクリートの縁に座っているデジタルペイント。背景には都市の質感ある壁があります。

アート画像

濃い霧の中、オレンジと青の光に照らされた高層ビルが立ち並び、雲の上に浮かぶ大きな円形の浮遊構造物を中心とした未来的な都市景観。
閉じた目の顔を特徴とするクローズアップの抽象肖像画。三色インクで作成され、爆発的な筆使いとオレンジ、青、赤、黒の飛沫が感情の強さと混沌としたエネルギーを伝えています。
鮮やかな赤い顔、黄色い目、複雑な白黒の模様、羽毛のような毛皮の質感が黒い背景に描かれたマンドリルの頭部の詳細なデジタルイラスト。
夜の雨の中で人の上に迫る赤と黒のドラゴンのスケッチ。
暗い背景に際立つ赤、白、黒の色彩で描かれた水中の金魚の抽象的なアクリル画
ナポレオン時代とサイバーパンクスタイルを融合させたエレガントな金のアクセントが施された海軍制服を着た、ジンジャーヘアと青い目の決意に満ちた軍司令官の肖像。煙が立ち込める都市の要塞に立っています。
そばかすのあるエルフの女性血魔術師の詳細な肖像。スカーレットのフードとローブを身に着け、血のように赤い目と複雑な魔法の紋章が暗い森の洞窟の中で渦巻いている。
ベージュの背景に立つ女性のシルエットの周りに、赤、黄色、青、オレンジ、紫の鮮やかでカラフルなフラクタルのようなペイント飛沫が広がっている様子。
黒いレザーブラレットとハイウエストのワイドパンツを着て自信に満ちた姿で腕を広げて立つスタイリッシュな女性。彼女は長い編み込みの髪を持ち、明るい緑のプラットフォームヒールを履いています。背景は緑色のトーンと影のパターンが特徴です。
コート・ダジュール海岸上の大きな青空に白い雲と飛行機雲が広がる中、南フランス・カップ・カナイユのビーチを歩く細身の女性のシルエットを示すミニマリストのフラットベクター作品。

基本モデル画像

暗く不吉な空の下、光るジャックオーランタンに照らされた不気味な墓地を歩くゾンビや骸骨を含むアンデッドキャラクターの写実的なシーン。

ロゴ画像

オーバーウォッチのD.VAがタイトな青と白のボディスーツを着てひざまずきながらハンドガンを持ち、背景にはピンク調の大きなクローズアップでブラウンの目の顔が描かれているデジタルアート。
ストライプの従業員シャツを着て、インスタントラーメンのカップやさまざまな商品が並ぶショップカウンターの後ろに立つ、大きなイカのようなヒューマノイドキャラクターのイラスト。詳細な線画のハッチングと土色調で描かれています。
スチームパンクスタイルのコーヒーマシンと笑顔の少女、水彩スケッチ。
ブルーアーカイブのちびシロコのピクセルアート。アイソメトリックグリッドで剣を持つ。
燃えるろうそくと果物の超リアルな静物画。

リアリズム画像

濃密な葉に囲まれた青々とした草原のデジタルアートで、木漏れ日が差し込み、小さな白い花が点在している。
黒のノースリーブトップと複雑なメタルカラーを身につけ、窓際で煙を吐く短髪の若者の肖像。
もしゃもしゃの茶色と灰色の毛皮を持ち、ポンポン付きの暗いニットビーニー、汚れた緑色のジャケット、暗いズボン、非常に大きく汚れたスニーカーを履いた擬人化された犬が、ぼやけた都市の建物を背景に濡れた都会の地面に立っている。
流れる赤い髪のファンタジー戦士女性、毛皮のマントと革の鎧を着用し、部族のタトゥーで飾られ剣を持ち、クマのそばに立っている。
バットマンが彼の黒いスーツを着て、冠水した足首までの水に浸った白いプラスチック椅子に座り、豪雨の中でビール瓶を持っている都市の通り。
ドラマチックな暗い背景に黄金のしぶきが散る中、黄金の機械部品とロボットの優雅さを持つ未来的なスチームパンクサイボーグ女性の横顔。
そばかすと灰緑色の目を持つ赤毛の少女が、緑のシルクローブを着て、シネマティックな照明の暗いアパートで木製のテーブルの上に身を乗り出し、ガラスの魚鉢でベタに餌をやっている様子。
紫の無地背景に対して詳細な機械部品を持つリアルな女性アンドロイドの横顔ビュー。
暗いティールの背景に対して、金の幾何学模様が入った白のオフショルダードレスを着た、暗色の非対称な肩までの髪と赤い唇のスタイリッシュな若い韓国女性。オレンジ色の色付きメガネと頭の後ろのオレンジ色の渦巻く光輪が特徴的。