modelos/Stable Cascade - base

Stable Cascade - base

|
9/20/2025
|
1:06:01 PM
| Discussion

Palabras Clave y Etiquetas Relacionadas

Un retrato fantástico realista de una mujer con cabello rubio miel y ojos esmeralda, mirando hacia arriba con una lágrima en la mejilla, usando aretes y collar de plata.
Cuatro heroínas neo-victorianas en un conservatorio del ático bañado por el sol con cabello ondeante y chispas mágicas, con un paisaje urbano y dirigibles al atardecer.

Parámetros Recomendados

steps

10 - 20

resolution

1024x1024

Consejos

Usa la versión de 3.6 mil millones de parámetros de la Etapa C para obtener los mejores resultados, ya que el ajuste fino principal se hizo en ella.

Usa la variante de 1.5 mil millones de parámetros para la Etapa B para destacar en la reconstrucción de detalles pequeños y finos.

El modelo es muy adecuado para entrenamientos e inferencias eficientes debido al espacio latente más pequeño y soporta extensiones como finetuning, LoRA, ControlNet, IP-Adapter y LCM.

El modelo está destinado únicamente a fines de investigación y no debe usarse para generar representaciones fácticas ni violar la Política de Uso Aceptable de Stability AI.

Los rostros y personas pueden no generarse correctamente ya que la auto codificación del modelo es con pérdida.

Patrocinadores del Creador

Demostraciones:

Stable Cascade

Este modelo se basa en la arquitectura Würstchen y su principal

diferencia con otros modelos como Stable Diffusion es que funciona en un espacio latente mucho más pequeño. ¿Por qué es esto

importante? Cuanto más pequeño es el espacio latente, más rápido se puede ejecutar la inferencia y más barato se vuelve el entrenamiento.

¿Qué tan pequeño es el espacio latente? Stable Diffusion usa un factor de compresión de 8, resultando en que una imagen de 1024x1024 se

codifica a 128x128. Stable Cascade logra un factor de compresión de 42, lo que significa que es posible codificar una

imagen de 1024x1024 a 24x24, manteniendo reconstrucciones nítidas. Luego, el modelo condicionado por texto se entrena en el

espacio latente altamente comprimido. Versiones anteriores de esta arquitectura lograron una reducción del costo de 16 veces respecto a Stable

Diffusion 1.5. <br> <br>

Por lo tanto, este tipo de modelo es muy adecuado para usos donde la eficiencia es importante. Además, todas las extensiones conocidas

como finetuning, LoRA, ControlNet, IP-Adapter, LCM, etc., también son posibles con este método.

Detalles del Modelo

Descripción del Modelo

Stable Cascade es un modelo de difusión entrenado para generar imágenes a partir de un prompt de texto.

  • Desarrollado por: Stability AI

  • Financiado por: Stability AI

  • Tipo de modelo: Modelo generativo de texto a imagen

Fuentes del Modelo

Para fines de investigación, recomendamos nuestro repositorio en StableCascade en Github (https://github.com/Stability-AI/StableCascade).

Resumen del Modelo

Stable Cascade consta de tres modelos: Etapa A, Etapa B y Etapa C, representando una cascada para generar imágenes,

de ahí el nombre "Stable Cascade".

Las Etapas A y B se usan para comprimir imágenes, similar a lo que hace el VAE en Stable Diffusion.

Sin embargo, con esta configuración, se puede lograr una compresión mucho mayor de imágenes. Mientras que los modelos de Stable Diffusion usan un

factor de compresión espacial de 8, codificando una imagen con resolución de 1024 x 1024 a 128 x 128, Stable Cascade logra

un factor de compresión de 42. Esto codifica una imagen de 1024 x 1024 a 24 x 24, pudiendo decodificar la

imagen con precisión. Esto conlleva la gran ventaja de entrenamientos e inferencias más económicos. Además, la Etapa C es responsable

de generar los pequeños latentes 24 x 24 dado un texto prompt. La siguiente imagen muestra esto visualmente.

Para este lanzamiento, ofrecemos dos puntos de control para la Etapa C, dos para la Etapa B y uno para la Etapa A. La Etapa C viene con

una versión de 1 mil millones y otra de 3.6 mil millones de parámetros, pero recomendamos encarecidamente usar la versión de 3.6 mil millones, ya que la mayor parte del trabajo fue

realizado en su ajuste fino. Las dos versiones para la Etapa B tienen 700 millones y 1.5 mil millones de parámetros. Ambas logran

excelentes resultados, sin embargo, la de 1.5 mil millones destaca en reconstruir detalles pequeños y finos. Por lo tanto, se obtienen

mejores resultados si se usa la variante más grande de cada una. Finalmente, la Etapa A contiene 20 millones de parámetros y es fija debido a

su pequeño tamaño.

Evaluación

Según nuestra evaluación, Stable Cascade tiene el mejor desempeño tanto en alineación con el prompt como en calidad estética en casi todas

las comparaciones. La imagen superior muestra los resultados de una evaluación humana usando una mezcla de parti-prompts (enlace) y prompts estéticos. Específicamente, Stable Cascade (30 pasos de inferencia) se comparó contra Playground v2 (50 pasos de inferencia), SDXL (50 pasos de inferencia), SDXL Turbo (1 paso de inferencia) y Würstchen v2 (30 pasos de inferencia).

Ejemplo de Código

⚠️ Importante: Para que el código a continuación funcione, debe instalar diffusers desde esta rama mientras la PR está en desarrollo.

pip install git+https://github.com/kashif/diffusers.git@wuerstchen-v3

import torch

from diffusers import StableCascadeDecoderPipeline, StableCascadePriorPipeline

device = "cuda"

num_images_per_prompt = 2

prior = StableCascadePriorPipeline.from_pretrained("stabilityai/stable-cascade-prior", torch_dtype=torch.bfloat16).to(device)

decoder = StableCascadeDecoderPipeline.from_pretrained("stabilityai/stable-cascade", torch_dtype=torch.float16).to(device)

prompt = "Gato antropomórfico vestido como piloto"

negative_prompt = ""

prior_output = prior(

prompt=prompt,

height=1024,

width=1024,

negative_prompt=negative_prompt,

guidance_scale=4.0,

num_images_per_prompt=num_images_per_prompt,

num_inference_steps=20

)

decoder_output = decoder(

image_embeddings=prior_output.image_embeddings.half(),

prompt=prompt,

negative_prompt=negative_prompt,

guidance_scale=0.0,

output_type="pil",

num_inference_steps=10

).images

#Ahora decoder_output es una lista con tus imágenes PIL

Usos

Uso Directo

El modelo está destinado por ahora a fines de investigación. Áreas y tareas posibles de investigación incluyen

  • Investigación sobre modelos generativos.

  • Despliegue seguro de modelos que tienen el potencial de generar contenido dañino.

  • Exploración y comprensión de las limitaciones y sesgos de los modelos generativos.

  • Generación de obras de arte y uso en diseño y otros procesos artísticos.

  • Aplicaciones en herramientas educativas o creativas.

Usos excluidos se describen a continuación.

Uso Fuera del Alcance

El modelo no fue entrenado para representar fiel o verdaderamente a personas o eventos,

por lo tanto, usar el modelo para generar dicho contenido está fuera del alcance de las capacidades de este modelo.

El modelo no debe usarse de ninguna manera que viole la Política de Uso Aceptable de Stability AI.

Limitaciones y Sesgos

Limitaciones

  • Los rostros y personas en general pueden no generarse correctamente.

  • La parte de auto codificación del modelo es con pérdida.

Recomendaciones

El modelo está destinado únicamente para fines de investigación.

Cómo Comenzar con el Modelo

Consulta https://github.com/Stability-AI/StableCascade

Anterior
Midnight - v5.0
Siguiente
Emulación de Película - Halación 35mm (Sutil)

Detalles del Modelo

Tipo de modelo

Checkpoint

Modelo base

Stable Cascade

Versión del modelo

base

Hash del modelo

0d28c8562d

Discusión

Por favor log in para dejar un comentario.

Imágenes por Stable Cascade - base

Un retrato fantástico realista de una mujer con cabello rubio miel y ojos esmeralda, mirando hacia arriba con una lágrima en la mejilla, usando aretes y collar de plata.
Cuatro heroínas neo-victorianas en un conservatorio del ático bañado por el sol con cabello ondeante y chispas mágicas, con un paisaje urbano y dirigibles al atardecer.

Imágenes con anime

Una mujer adulta Aka-Oni con piel roja y cuernos negros, cabello azul que cubre parcialmente su rostro, frotándose un ojo mientras sostiene un juguete de peluche con cuernos, en una iluminación suave y detallada.
Una diosa de la primavera con cabello muy largo y multicolor, vistiendo un vestido blanco fluido, sentada pacíficamente entre flores de loto y vegetación al amanecer, con pájaros volando contra un cielo azul claro.
Una mujer con cabello largo y castaño, blusa blanca y falda de cuadros negra camina sobre un estrecho puente de madera alto sobre las nubes bajo un cielo azul brillante lleno de aves volando.
Obra digital de una cyborg femenina con cabello largo y castaño flotando en un ambiente ciberpunk futurista, vestida con un traje robótico segmentado con cables rojos y luz neón azul.
Primer plano de una chica anime abstracta con cabello blanco y patrones líquidos celestiales en su piel y un fondo abstracto densamente estampado.
Ilustración digital de una mujer de cabello azul sentada sobre un tanque metálico oxidado, usando overol de mezclilla y gafas, con un cielo lleno de nubes esponjosas de fondo.
Una mujer vagabunda de cabello corto camina descalza a través de agua hasta las rodillas en un diner art déco abandonado e inundado, iluminado por algas bioluminiscentes y luces colgantes.
Una escena de ciencia ficción que presenta un gran puerto espacial circular flotando sobre una isla desierta con nubes, mientras una figura con un traje blindado futurista está en un terreno rocoso observándolo.
Pintura digital de una chica con cabello largo y oscuro sentada en un borde de hormigón, vistiendo una camisa blanca y pantalones azules, bañada en luz natural suave, con un fondo de pared urbana texturizada
Una escena de fantasía que muestra a una chica elfa asustada con largo cabello castaño claro y ojos verdes penetrantes sosteniendo una antorcha encendida en una cueva oscura, mientras un esqueleto con ojos luminosos se cierne detrás de ella.

Imágenes con arte

Paisaje urbano futurista con altos rascacielos con luces naranjas y azules entre una densa niebla, centrado en una gran estructura circular flotante sobre las nubes.
Retrato abstracto en primer plano con un rostro de ojos cerrados, creado con tinta tricolor y pinceladas explosivas, salpicaduras de naranja, azul, rojo y negro, transmitiendo intensidad emocional y energía caótica.
Ilustración digital altamente detallada de la cabeza de un mandril con cara roja vibrante, ojos amarillos, patrones intrincados en blanco y negro, y textura de pelaje plumoso sobre fondo negro.
Un boceto rojo y negro de un dragón que se cierne sobre una persona bajo la lluvia en la noche.
Pintura acrílica abstracta de un pez dorado bajo el agua con colores llamativos rojo, blanco y negro sobre un fondo oscuro
Retrato de un comandante militar decidido con cabello rojizo y ojos azules que lleva un elegante uniforme azul marino con acentos dorados que combina estilos de la era napoleónica y ciberpunk, de pie en una fortaleza urbana llena de humo.
Un retrato detallado de una mujer hemomancer elfa pecosa con capucha y túnicas escarlata, ojos rojo sangre y símbolos mágicos intrincados girando en una cueva de bosque oscuro.
Silueta de una mujer de pie contra un fondo beige con salpicaduras coloridas vívidas similares a fractales en rojo, amarillo, azul, naranja y púrpura a su alrededor.
Mujer elegante con un bralette de cuero negro y pantalones de pierna ancha de talle alto, posando con confianza con los brazos extendidos. Tiene cabello largo trenzado y tacones plataforma verdes brillantes. El fondo presenta tonos verdes con patrones de sombras.
Obra vectorial plana minimalista que muestra la silueta de una mujer delgada caminando en la playa de Cap Canaille, sur de Francia, con un gran cielo azul lleno de nubes blancas y estelas sobre la costa de la Côte d'Azur.

Imágenes con modelo base

Escena fotorrealista de personajes no muertos incluyendo zombis y esqueletos caminando por un cementerio tenebroso iluminado por calabazas Jack-o'-lantern brillantes bajo un cielo oscuro y ominoso.

Imágenes con logo

Arte digital de D.VA de Overwatch en un traje ajustado azul y blanco, sosteniendo una pistola mientras está de rodillas, con un gran primer plano de su rostro de ojos marrones en tonos rosas al fondo.
Ilustración de un personaje humanoide grande parecido a un calamar que lleva una camisa de empleado a rayas, de pie detrás de un mostrador de tienda lleno de tazas de fideos instantáneos y varios artículos, dibujado con rayado lineal detallado y tonos terrosos.
Máquina de café estilo steampunk con niña sonriente, boceto acuarela.
Pixel art de la chibi Shiroko de Blue Archive con una espada en una cuadrícula isométrica.
Un bodegón detallado con varias frutas y velas encendidas, generado por IA usando Stable Diffusion.

Imágenes con realismo

Un perro antropomórfico muy detallado con pelaje marrón y gris despeinado que lleva un gorro de punto oscuro con pompón metálico, una chaqueta verde sucia, pantalones oscuros y zapatillas sucias y de gran tamaño, de pie sobre un suelo urbano mojado con edificios de la ciudad borrosos al fondo.
Mujer guerrera fantástica con cabello rojo ondulado, vistiendo una capa de piel y armadura de cuero, adornada con tatuajes tribales y sosteniendo una espada, parada junto a un oso.
Batman con su traje negro sentado en una silla de plástico blanca sumergida en agua de inundación hasta los tobillos, sosteniendo una botella de cerveza bajo lluvia intensa en una calle urbana.
Perfil lateral de una mujer ciborg steampunk futurista con partes mecánicas doradas y elegancia robótica, sobre un fondo oscuro dramático con salpicaduras doradas.
Una chica pelirroja con pecas y ojos gris-verdes se inclina sobre una mesa de madera alimentando a un pez betta en un acuario de vidrio, vistiendo una bata de seda verde, en un apartamento oscuro con iluminación cinematográfica.
Perfil lateral de un androide femenino realista con partes mecánicas detalladas sobre un fondo púrpura sólido.
Una joven mujer coreana con cabello oscuro asimétrico a la altura de los hombros y labios rojos, vestida con un vestido blanco sin hombros con patrones geométricos dorados, gafas tintadas de naranja, y un halo espiral naranja detrás de su cabeza contra un fondo teal oscuro.
Una joven con cabello largo y ondulado castaño lleva un vestido gris floral sin tirantes con acentos de cinta negra en un campo montañoso exuberante con flores silvestres blancas bajo cielos nublados.
Una ilustración hiper detallada de un hombre negro atractivo con piel oscura en equipo táctico, vistiendo un chaleco blindado gris, guantes negros, máscara negra de medio rostro, sosteniendo dos pistolas apuntando hacia adelante, sobre un fondo blanco.