Qué es Stable Diffusion
Stable Diffusion es la familia de modelos de difusión de código abierto que, desde 2022, sostiene buena parte de los editores de imagen con IA.
Stable Diffusion es una familia de modelos de imagen basados en difusión latente, publicada con pesos abiertos en agosto de 2022 por Stability AI, CompVis y Runway. Genera imágenes a partir de texto y edita fotos con img2img e inpainting. Como cualquiera puede descargarla y ajustarla, sostiene muchas herramientas de la categoría, con y sin filtro de contenido.
Cómo funciona la difusión latente
El modelo aprende a quitar ruido. Durante el entrenamiento se le muestran imágenes a las que se añade ruido paso a paso, y aprende a revertir el proceso; al generar, parte de ruido puro y lo limpia en 20 a 50 pasos hasta obtener una imagen que coincide con el texto. El texto lo interpreta un codificador CLIP; la imagen la limpia una red U-Net.
La palabra «latente» viene del artículo de Rombach, Blattmann, Lorenz, Esser y Ommer (2022): en lugar de trabajar sobre los píxeles, el modelo opera en un espacio comprimido por un autocodificador, ocho veces más pequeño por lado. Por eso la primera versión generaba 512 × 512 píxeles en una tarjeta gráfica de consumo, algo que los modelos anteriores no lograban.
Versiones principales
| Versión | Fecha | Rasgo |
|---|---|---|
| 1.4 | Agosto 2022 | Primera pública, 512 px |
| 1.5 | Octubre 2022 | Base de la mayoría de los ajustes |
| 2.0 / 2.1 | Noviembre–diciembre 2022 | 768 px, datos con filtro |
| SDXL 1.0 | Julio 2023 | 1024 px, dos etapas |
| SD 3 / 3.5 | 2024 | Transformadores, licencia propia |
Fechas de publicación de los pesos según los anuncios de Stability AI y los repositorios de CompVis y Hugging Face. Muchas herramientas de la categoría siguen sobre la versión 1.5 por la cantidad de ajustes disponibles.
Por qué sostiene tantas herramientas
La diferencia con DALL·E o Midjourney no es la calidad, sino la licencia: los pesos se descargan, se ejecutan en un computador propio y se modifican. Sobre esa base creció un ecosistema completo: ajustes ligeros con LoRA, control de pose con ControlNet, un modelo específico de inpainting y varias interfaces gratuitas.
El repositorio oficial incluye un clasificador NSFW que bloquea la salida explícita, pero es una línea de código que cualquiera puede desactivar. Los servicios para desnudar fotos son, en su mayoría, ese mismo modelo con el filtro apagado y un ajuste entrenado con imágenes de desnudos. La licencia OpenRAIL-M prohíbe usos que dañen o acosen a personas; hacerla cumplir es otra cosa.
Límites y señales típicas
- Manos, dedos y texto: la versión 1.5 los deforma con frecuencia; SDXL mejoró, sin resolverlo del todo. Son las primeras señales que busca la detección de deepfakes.
- Anatomía inventada: en inpainting el modelo no ve lo que hay bajo la máscara; predice a partir de sus datos de entrenamiento y falla con poses, luz o ropa poco habituales.
- Datos de entrenamiento: las versiones 1.x se entrenaron con subconjuntos de LAION, un índice público de imágenes de internet; las 2.x aplicaron un filtro de contenido explícito a esos datos.
- Servidor o computador propio: ejecutarla en un equipo propio evita subir la foto; los servicios web la procesan en su servidor, y su política de datos decide qué pasa después.
- Límite editorial: este sitio no ejecuta modelos ni recibe fotos; describe la tecnología y reseña servicios de terceros con fotos de control propias.
En Chile
El modelo es neutro y su uso es legal; lo que la ley evalúa es el resultado y su difusión. Generar un desnudo de una persona identificable sin su consentimiento y difundirlo puede caer en el artículo 161-C del Código Penal (Ley 21.153, 2019) o en el artículo 161-D (Ley 21.675, 2024), que sanciona exhibir o difundir un registro íntimo sin autorización expresa.
Subir la foto de un tercero a un servicio que la procesa es tratar un dato biométrico sin consentimiento según la Ley 21.719, vigente desde el 1 de diciembre de 2026. El Boletín 17.795-19, sobre deepfakes, y el Boletín 17.618-19, sobre el sello para contenido generado con IA, siguen en trámite. Esta entrada informa; no es asesoría legal.
Términos relacionados
- Inpainting: la técnica de relleno que este modelo popularizó y que usan los editores de ropa.
- LoRA: el ajuste ligero con el que se cambia estilo o anatomía sin reentrenar el modelo.
- ControlNet: el módulo que fija pose y contorno durante la generación.
Herramientas relacionadas
Los servicios que construyen sobre esta familia de modelos, con y sin filtro, están comparados en la guía de IA para desnudar; las fichas con puntaje y fecha de prueba, en el catálogo de apps para desnudar.
Preguntas frecuentes sobre Stable Diffusion
¿El modelo es gratis?
Los pesos se descargan sin costo bajo licencia OpenRAIL-M. El gasto real es el hardware: una tarjeta gráfica con memoria suficiente. Los servicios web que lo ejecutan por ti cobran créditos o suscripción.
¿Necesito un computador potente para usarlo?
Para ejecutarlo en tu equipo, sí: una GPU dedicada. La alternativa son los servicios web, con la diferencia de que la foto sale de tu equipo y queda sujeta a la política del proveedor.
¿El modelo desnuda fotos por sí solo?
El modelo base con su filtro activo, no. Los ajustes sin filtro entrenados con desnudos, sí; son la base técnica de la categoría que reseñamos. La diferencia está en el filtro y en el uso.
¿Qué diferencia hay con DALL·E o Midjourney?
Esos modelos son cerrados: se usan a través del servicio de su empresa, con filtro obligatorio y sin acceso a los pesos. Este modelo se descarga, se modifica y se ejecuta donde el usuario quiera.
¿Es legal usar Stable Diffusion en Chile?
Sí. Lo que puede ser delito es el resultado: un desnudo de una persona identificable sin consentimiento, difundido, cae en los artículos 161-C o 161-D del Código Penal y en la Ley 21.719 de datos.
Seguir leyendo
- GAN: la arquitectura anterior, la de DeepNude, y sus artefactos típicos.
- nude IA: generadores probados: qué generadores usan modelos abiertos sin filtro y cómo rinden.
- Cambiar ropa con IA vs quitar ropa: dos familias de herramientas sobre la misma base.
- Cómo detectar un deepfake: las señales que dejan los modelos de difusión.
Fuentes
- Rombach, Blattmann, Lorenz, Esser y Ommer (2022) — «High-Resolution Image Synthesis with Latent Diffusion Models», arXiv 2112.10752: arxiv.org.
- Stability AI, 22/08/2022 — anuncio de la publicación de Stable Diffusion: stability.ai.
- CompVis — repositorio oficial del modelo, con el filtro de seguridad y la licencia OpenRAIL-M: github.com.
- Hugging Face — documentación de Diffusers para modelos de difusión: huggingface.co.
- Biblioteca del Congreso Nacional — Ley N.° 21.153, artículo 161-C del Código Penal: bcn.cl.
- Biblioteca del Congreso Nacional — Ley N.° 21.719 de protección de datos personales: bcn.cl.