Glosario · Técnicas

Qué es ControlNet

ControlNet añade a un modelo de difusión una guía espacial (bordes, profundidad, pose) para que la imagen generada respete la estructura de la foto original.

ControlNet es un módulo que se acopla a un modelo de difusión ya entrenado, como Stable Diffusion, y le impone una condición espacial: un mapa de bordes, de profundidad, de segmentación o de pose humana. Lo propusieron Zhang, Rao y Agrawala en febrero de 2023. El modelo base queda congelado; solo se entrena la copia ligera que traduce la guía.

Cómo funciona

El módulo copia los bloques del codificador del modelo base y los conecta con «convoluciones en cero»: capas inicializadas en cero que al inicio no alteran nada y aprenden de forma gradual. El modelo base permanece bloqueado, así que no pierde lo que ya sabía. Durante la generación, la copia entrenada recibe el mapa de guía y empuja el resultado hacia esa estructura.

Según el artículo original, el entrenamiento resulta estable tanto con conjuntos pequeños (menos de 50.000 ejemplos) como con grandes (más de un millón). En la práctica, el usuario elige el tipo de guía, prepara el mapa a partir de la foto y fija un peso de condicionamiento entre 0 y 1: cuanto más alto, más se parece la salida a la estructura original.

Tipos de guía

GuíaQué fijaUso habitual
Bordes (Canny)Contorno de objetos y figuraConservar la silueta
ProfundidadVolumen y distancia al fondoCambiar el escenario
SegmentaciónZonas: piel, ropa, fondoEditar una prenda por zona
Pose (OpenPose)Esqueleto y posición del cuerpoMantener la postura
Boceto o líneasTrazo dibujado a manoIlustración desde un croquis

Varias guías se combinan en una misma generación (Multi-ControlNet), cada una con su propio peso.

Por qué importa en esta categoría

Un editor de ropa con IA necesita dos cosas: rellenar la zona marcada (inpainting) y que el relleno respete postura, contorno y proporción del cuerpo. Sin guía, el modelo inventa otra figura; con guía de pose o de bordes, el resultado encaja con el resto de la imagen. Esa combinación explica el salto de calidad frente a DeepNude, que en 2019 usaba redes GAN sin control espacial.

En nuestras reseñas ese comportamiento se mide en el criterio de calidad (25 % del puntaje): coherencia de bordes, luz y textura en fotos de control propias. Ningún proveedor del catálogo declara qué guías usa; se evalúa el resultado, según cómo evaluamos.

Riesgos y límites

  • Mayor realismo, mayor daño: cuanto mejor respeta la pose de una persona real, más creíble es el deepfake si la foto es de un tercero.
  • Mapa derivado de la foto: la guía se extrae de la imagen subida, así que la foto completa viaja al servidor del proveedor.
  • Errores típicos: manos, dedos y joyas siguen fallando cuando la guía es imprecisa; son señales de la detección de deepfakes.
  • Dependencia del modelo base: la guía no añade contenido; un modelo con filtro NSFW rechaza el desnudo aunque la pose esté fijada.
  • Límite editorial: este sitio no ejecuta modelos ni recibe fotos; describe la técnica y reseña servicios de terceros.

En Chile

La técnica es neutra; la ley evalúa el uso. Generar y difundir el desnudo sintético de una persona identificable sin su consentimiento puede caer en el artículo 161-C del Código Penal (Ley 21.153, 2019) o en el 161-D (Ley 21.675, 2024), que sanciona exhibir o difundir un registro íntimo sin autorización expresa.

Subir la foto de un tercero al servicio que extrae la guía y genera la imagen es tratar un dato biométrico sin consentimiento según la Ley 21.719, vigente desde el 1 de diciembre de 2026. El Boletín 17.795-19 sobre deepfakes sigue en trámite. Esta entrada informa; no es asesoría legal.

Términos relacionados

  • Inpainting: el relleno de la zona marcada que la guía mantiene en su sitio.
  • Stable Diffusion: el modelo base al que se acopla con más frecuencia.
  • LoRA: el adaptador de estilo o anatomía que se combina con la guía de pose.

Herramientas relacionadas

Los editores que aplican estas técnicas a la ropa están comparados en quitar ropa con IA y en editores que quitan ropa de fotos; las fichas con puntaje y fecha de prueba, en el catálogo de apps para desnudar.

Preguntas frecuentes sobre ControlNet

¿Qué hace ControlNet en una imagen?

Fija la estructura: toma un mapa de bordes, profundidad, segmentación o pose y obliga al modelo de difusión a generar dentro de esa forma. El contenido lo siguen poniendo el modelo base y el texto.

¿ControlNet cambia el modelo base?

No. El modelo base queda bloqueado; se entrena una copia ligera conectada con convoluciones en cero. Por eso funciona sobre Stable Diffusion y otros modelos sin degradarlos.

¿Se usa junto con inpainting?

Sí. La canalización habitual combina máscara, guía y texto: el inpainting decide qué zona se rellena y la guía, qué forma debe respetar el relleno.

¿Por qué las apps para desnudar mantienen la pose?

Porque extraen de la foto una guía de pose o de bordes y la aplican durante el relleno. El cuerpo generado encaja con la postura original y el deepfake resulta más creíble.

¿Es legal usar ControlNet en Chile?

La técnica sí. Con la foto de otra persona sin consentimiento, subirla es tratar un dato biométrico (Ley 21.719) y difundir el desnudo sintético puede ser delito por los artículos 161-C o 161-D.

Seguir leyendo

Fuentes

  • Zhang, Rao y Agrawala (2023) — «Adding Conditional Control to Text-to-Image Diffusion Models», arXiv 2302.05543: arxiv.org.
  • Hugging Face — documentación de Diffusers, guía de ControlNet: huggingface.co.
  • lllyasviel — repositorio oficial de ControlNet: github.com.
  • Biblioteca del Congreso Nacional — Ley N.° 21.153, artículo 161-C del Código Penal: bcn.cl.
  • Biblioteca del Congreso Nacional — Ley N.° 21.719 de protección de datos personales: bcn.cl.