top of page

Serie ComfyUI (XX) — Consistencia de personajes con ControlNet, LoRA y prompts

  • 11 jul
  • 16 min de lectura

Continuamos la Serie ComfyUI, donde estamos explorando cómo construir workflows cada vez más útiles, controlables y flexibles para generación de imágenes con IA en local.


En los últimos artículos hemos trabajado con ControlNet, LoRA, Multi-ControlNet, FLUX Turbo y Multi-LoRA, y poco a poco hemos ido ganando control, velocidad, flexibilidad y capacidad de experimentación.


Cuando empiezas a trabajar de forma más seria con generación de imágenes aparece uno de los mayores retos de todos: la consistencia de personajes, porque generar una imagen interesante es relativamente sencillo, pero generar varias imágenes del mismo personaje ya es otra historia completamente distinta.


Cuando intentas generar varias imágenes del mismo personaje suelen aparecer muchos problemas: cambia la cara, el peinado, la ropa, la autonomia, incluso aunque estés usando el mismo modelo y prompt. Esto nos afecta a la hora de crear workflows orientados a cómics, storytelling, branding, uso de personajes recurrentes.


Aquí es donde muchos usuarios descubren algo importante: la IA no “recuerda” realmente un personaje. Cada generación es un nuevo intento de reinterpretar el prompt, y por eso aparecen variaciones, cambios de detalle e inconsistencias aunque la descripción sea parecida.


En este artículo NO vamos a usar todavía IPAdapter, y eso es completamente intencionado, porque antes de utilizar referencia visual directa, es importante entender cómo funciona realmente la consistencia dentro de un workflow generativo. La idea es aprender a acercarnos a consistencia utilizando prompts consistentes, LoRA, ControlNet (OpenPose) y seeds, es decir, construir consistencia “semi-manual”.


Captura de ComfyUI: flujo SDXL para consistencia de personajes con ControlNet, LoRA y prompts; vistas de una mujer futurista.
Consistencia de personajes con ControlNet, LoRA y prompts

⚠️ El nuevo problema: mantener identidad entre imágenes

En generación de imágenes con IA hay algo que suele sorprender muchísimo al principio. Conseguir una imagen buena es relativamente fácil, conseguir varias imágenes coherentes entre sí es muchísimo más difícil, y aquí es donde aparece uno de los mayores problemas de los workflows generativos modernos: la consistencia de personajes.


Cuando intentas generar varias imágenes del mismo personaje suelen empezar a aparecer pequeñas variaciones: cambia la cara, el peinado, la ropa, la iluminación y la anatomía aunque estés utilizando el mismo prompt, modelo y estilo visual.


Es importante entender algo clave: la IA no “recuerda” realmente un personaje. Cada generación es una reinterpretación nueva del prompt, el modelo intenta reconstruir visualmente la descripción cada vez desde cero, y por eso aparecen esas variaciones.


Cuando empiezas a utilizar LoRA, distintos prompts, múltiples escenas, diferentes poses, estilos híbridos, la consistencia se vuelve todavía más difícil.


La falta de consistencia afecta muchísimo a workflows orientados a storytelling, cómics, manga, branding, personajes recurrentes, pipelines cinematográficos, porque en todos esos casos necesitas que el personaje siga siendo reconocible entre imágenes distintas.


La consistencia visual no depende de un único parámetro mágico. Depende del equilibrio entre múltiples elementos que van a trabajar juntos:

Elemento

Qué aporta

Prompt

descripción del personaje

LoRA

estilo visual

OpenPose

estructura corporal

Seed

estabilidad compositiva

CFG / sampler

coherencia general

Elementos icónicos

reconocimiento visual


En el workflow de este artículo vamos a intentar acercarnos a consistencia utilizando únicamente prompts consistentes, OpenPose (controlNet), LoRA, seeds y estructura visual. Es decir: consistencia “semi-manual”, y eso es MUY importante porque nos permitirá entender cómo funciona realmente la identidad visual dentro de un pipeline generativo.

Es interesante porque antes de utilizar herramientas más avanzadas como IPAdapter, es fundamental entender

qué ayuda realmente a mantener identidad, qué provoca drift visual, qué parámetros influyen más y cuáles son las limitaciones reales del modelo, y este artículo trata precisamente de eso.


🧠 La idea clave: la consistencia no depende de una sola herramienta

Uno de los errores más comunes cuando alguien empieza a trabajar con consistencia de personajes es pensar que existe un único parámetro mágico capaz de resolver el problema. La consistencia visual no depende de una sola herramienta, sino del equilibrio entre múltiples elementos que trabajan juntos dentro del workflow.


🧩 Los pilares de la consistencia

En este workflow trabajaremos principalmente con cinco elementos:

Elemento

Función

Prompt

mantiene descripción del personaje

LoRA

mantiene estilo visual

OpenPose

mantiene estructura corporal

Seed

aporta estabilidad compositiva

Elementos icónicos

ayudan al reconocimiento

Ninguno de ellos es suficiente por separado, la consistencia aparece de la combinación de todos.


📝 1. Prompt — identidad descriptiva

El prompt es el primer nivel de consistencia. Aquí definimos pelo, ropa, colores, estética, atmósfera y rasgos importantes. Por ejemplo, en este workflow utilizamos elementos muy reconocibles: short white hair, glowing blue energy core, tactical sci-fi armor, dark cobalt blue, industrial cyberpunk style.

Cuanto más consistentes sean estos elementos más estable será la identidad visual.


🎨 2. LoRA — coherencia estética

El LoRA ayuda muchísimo porque introduce una interpretación visual relativamente estable. No solo afecta al estilo general sino que tambíen influye sobre la iluminación, las texturas, el contraste, los detalles visuales y la estética del personaje.

En nuestro workflow en este artículo utilizaremos un único LoRA cyberpunk precisamente para evitar conflictos visuales, exceso de variaciones y drift estilístico. Menos complejidad = más estabilidad.


🧍 3. OpenPose — estabilidad estructural

Aquí entra ControlNet. OpenPose nos permite controlar la postura, la posición corporal y la estructura general del personaje.

Esto es MUY importante porque muchas veces el personaje parece “distinto” simplemente porque cambia la pose, la silueta o la proporción visual. Controlando estructura corporal conseguimos mantener mucha más coherencia entre imágenes.


🎲 4. Seed — estabilidad compositiva

La seed sigue siendo muy importante. Mantener la misma seed ayuda a conservar composición general, mantener ciertos patrones visuales y reducir variaciones extremas.

No garantiza identidad perfecta, pero sí ayuda muchísimo a mantener coherencia visual.


💡 5. Elementos icónicos — reconocimiento visual

Este es uno de los factores más infravalorados. Los personajes memorables suelen tener elementos visuales muy reconocibles. En este workflow utilizamos: "pelo blanco corto", "núcleo azul brillante", "armadura táctica negra" y "estética sci-fi industrial". Estos elementos funcionan como “anclas visuales” y ayudan muchísimo al cerebro humano a percibir continuidad entre imágenes.


🎯 Qué vas a lograr

El objetivo no va a ser conseguir una clonación perfecta. El objetivo es aprender cómo acercarnos a consistencia visual utilizando prompts, LoRA, OpenPose, seeds y estructura visual, es decir: entender cómo funciona realmente la consistencia dentro de un pipeline generativo.


Al finalizar este artículo serás capaz de:

  • Entender por qué los personajes cambian entre generaciones

  • Comprender qué provoca el drift visual

  • Utilizar OpenPose para mantener estructura corporal

  • Construir workflows orientados a consistencia visual

  • Utilizar LoRA para estabilizar estilo

  • Diseñar prompts más consistentes

  • Aprovechar seeds para mejorar coherencia compositiva

  • Mantener personajes reconocibles entre múltiples imágenes


🧩 Requisitos

Para seguir este artículo y ejecutar correctamente el workflow de consistencia de personajes en ComfyUI, necesitas lo siguiente:

💻 Entorno

Necesitas tener:

  • ComfyUI instalado y funcionando correctamente

  • GPU recomendada para trabajar de forma fluida

Aunque este workflow no es extremadamente pesado, ControlNet y SDXL consumen bastante más recursos que workflows simples.


🧠 Modelo base (SDXL)

En este workflow utilizamos:

Este modelo ofrece un muy buen equilibrio entre calidad visual, velocidad, estabilidad y detalle facial. Además funciona especialmente bien para sci-fi, cyberpunk y personajes cinematográficos


🎨 LoRA utilizado

En este artículo trabajaremos con un único LoRA:

El objetivo de utilizar solo un LoRA es reducir conflictos visuales, drift estilístico e inconsistencias innecesarias. Menos complejidad = más estabilidad.


🧍 ControlNet utilizado

El workflow utiliza:

  • OpenPose ControlNet

Modelo utilizado:

Este ControlNet nos permitirá controlar postura, mantener estructura corporal y generar distintas poses manteniendo coherencia visual


🖼️ Imagen de pose

El workflow parte de una imagen de referencia de pose.

Archivo utilizado:

  • Pose_reference_fururisticIndustrialFemale_03.png


La imagen ideal debería tener el cuerpo visible, las extremidades claras, poco solapamiento y postura reconocible. Cuanto más limpia sea la pose mejor funcionará OpenPose.


⚙️ Resolución utilizada

En este workflow trabajaremos con:

  • 768 × 1152

Resolución vertical muy útil para personajes completos, poses dinámicas y composición cinematográfica.


🧠 Prompt principal del workflow

El personaje utilizado en este artículo está diseñado específicamente para facilitar consistencia visual.

Prompt utilizado:

futuristic industrial female guardian, short free white hair, glowing blue energy core in chest, dark cobalt blue and pearl black full tactical sci-fi full armor, cyberpunk industrial style, full body, dark hacker atmosphere, dark factory background, detailed face, consistent character design, ultra detailed, realistic, high contrast

👉 El prompt incluye varios elementos visuales muy reconocibles: pelo blanco corto, núcleo azul brillante, armadura táctica negra y estética industrial cyberpunk. Estos elementos ayudan muchísimo a mantener identidad visual entre imágenes.


🚫 Prompt negativo

También utilizaremos un prompt negativo orientado a reducir errores anatómicos e inconsistencias:

bad anatomy, bad hands, extra fingers, missing fingers, extra limbs, deformed body, distorted face, blurry, low quality, watermark, text, logo, different outfit, different hair color

Aquí hemos añadido además "different outfit" y "different hair color" precisamente para reforzar consistencia visual.


🗂️ Crear o cargar el workflow en ComfyUI

Tienes dos maneras de trabajar con este flujo:

🅰️ Opción A — Cargar el workflow ya creado

1️⃣ Descarga el archivo JSON adjunto:📁 wf_ComfyUI_SDXL_CharacterConsistency_ControlNet_LoRA.json 


2️⃣ Abre ComfyUI.

3️⃣ En el menú superior selecciona:Workflow → Load

4️⃣ Carga el archivo JSON. Verás en el lienzo todos los nodos conectados y listos para funcionar.


Menú Workflow abierto con Open resaltado y una flecha hacia un diagrama de nodos en una interfaz gris.
Cargar workflow en ComfyUI

🅱️ Opción B — Crear el workflow desde cero

Si prefieres entenderlo pieza a pieza, puedes recrearlo manualmente. En la siguiente sección explicamos qué hace cada bloque del flujo.


Menú Workflow abierto con New resaltado y flecha hacia un lienzo vacío; arriba se lee Unsaved Workflow en una interfaz gris.
Empezar con workflow en blanco

🧠 Qué significa realmente “consistencia de personajes”

Cuando hablamos de consistencia de personajes en IA generativa es importante aclarar algo desde el principio: consistencia no significa clonación perfecta.


Muchas personas esperan que usando el mismo prompt, modelo y LoRA el personaje salga exactamente igual en cada imagen, pero los modelos generativos no funcionan así. Cada generación reinterpreta los detalles ajustará la escena y reconstruirá partes del personaje.


Entonces… ¿qué significa realmente consistencia?, en workflows generativos, consistencia normalmente significa "mantener suficiente coherencia visual para que el personaje siga siendo reconocible entre imágenes distintas". Eso incluye mismo estilo general, mismos colores, misma ropa, misma estética, mismos rasgos prinicipales y misma "identidad percibida" aunque existan pequeñas variaciones.


Aquí ocurre algo muy interesante. El cerebro humano no necesita que todo sea idéntico. Solo necesita suficientes elementos repetidos para interpretar continuidad. Por ejemplo mismo pelo, ropa rostro general, mismo elemento icónico y automáticamente percibimos: “es el mismo personaje”.


Por eso los personajes más memorables suelen tener elementos visuales muy reconocibles. En este workflow utilizaremos "pelo blanco corto", "núcleo azul brillante", "armadura táctica negra" y "estética sci-fi industrial". Estos elementos funcionan como anclas visuales y ayudan muchísimo a reforzar consistencia.


Otro concepto importante: "demasiada libertad rompe consistencia", pero demasiado control puede volver la imagen rígida o artificial. Por eso el objetivo real no es congelar completamente el personaje, sino mantener un equilibrio entre coherencia, variacion y naturalidad.


La pose influye muchísimo más de lo que parece, porque cambiar postura, angulo corporal, silueta y perspectiva, puede hacer que el personaje parezca completamente distinto, y aquí es donde OpenPose se vuelve especialmente importante ya que nos permite mantener una estructura corporal mucho más estable entre imágenes.


El LoRA también ayuda muchísimo a reforzar consistencia porque introduce iluminación coherente, textos similares, mismo lenguaje visual y estética repetivle. Esto hace que distintas imágenes “se sientan” parte del mismo universo visual.


La seed aporta estabilidad compositiva. Mantener la misma seed ayuda a reducir variaciones extremas, mantener ciertos patrones visuales y reforzar continuidad general, aunque por sí sola no garantiza identidad.


⚠️ Lo importante: aceptar pequeñas variaciones

Lo importante es mantener coherencia suficiente para que el personaje siga siendo reconocible y conseguir una consistencia narrativa, es decir:

  • un personaje reconocible

  • dentro del mismo universo visual

  • manteniendo identidad general

  • aunque existan pequeñas diferencias


⚙️ El workflow: estructura general

Una de las cosas más interesantes de este workflow es que, aunque está orientado a consistencia de personajes, sigue manteniendo una estructura relativamente simple y fácil de entender.


La lógica del workflow es la siguiente:

Checkpoint SDXL
      ↓
LoRA
      ↓
Prompt + Negative
      ↓
OpenPose
      ↓
ControlNet
      ↓
KSampler
      ↓
VAE Decode
      ↓
Preview / Save

👉 Todo el workflow gira alrededor de una idea muy concreta: repetir elementos visuales de forma controlada.


🧩 Qué hace cada bloque

Bloque

Función

CheckpointLoaderSimple

Carga el modelo SDXL

LoraLoader

Añade coherencia estilística

CLIPTextEncode

Define identidad del personaje

LoadImage

Carga referencia de pose

OpenPosePreprocessor

Detecta estructura corporal

ControlNetLoader

Carga ControlNet OpenPose

ControlNetApplyAdvanced

Aplica control estructural

EmptyLatentImage

Define resolución

KSampler

Genera la imagen

VAEDecode

Convierte latente → imagen

Save / Preview

Guarda y visualiza

🔗 Cómo fluye la información

En este workflow se combinan cuatro flujos principales:

🧠 1. Flujo del modelo base

El modelo SDXL aporta la capacidad principal de generación, y aquí es donde se construye el aspecto general de la imagen.

Checkpoint
    ↓
LoRA
    ↓
KSampler

🎨 2. Flujo de estilo

El LoRA introduce estabilidad visual.

LoRA cyberpunk
        ↓
Modelo SDXL

🧍 3. Flujo estructural

Aquí entra OpenPose y controlamos la postura, silueta y estructura corporal.

Imagen pose
      ↓
OpenPose
      ↓
ControlNet

📝 4. Flujo del prompt

El prompt define identidad, ropa, colores, atmósfera y rasgos del personaje. Cuanto más consistente sea el prompt más estable será el personaje

Prompt
   ↓
Conditioning
   ↓
KSampler

🧱 Entendiendo el workflow paso a paso

Vamos ahora a analizar el workflow nodo a nodo para entender cómo funciona realmente este pipeline de consistencia de personajes dentro de ComfyUI.


1️⃣ CheckpointLoaderSimple (modelo base)

Qué hace: carga el modelo SDXL principal utilizado en el workflow. En este caso:

Qué tocar:

  • El modelo SDXL cargado. Algunos modelos generan personajes más estables que otros.

Salida:

  • MODEL → LoraLoader

  • CLIP → LoraLoader

  • VAE → VAEDecode

  • VAE → ControlNetApplyAdvanced


Captura de ComfyUI con nodos Load Checkpoint, LoRA, CLIP Text Encode y ControlNet conectados en un flujo de IA.
LoadCheckpoint, LoadLoRA, CLIP Text Endoce

2️⃣ LoraLoader (estilo visual)

Qué hace: carga el LoRA utilizado para reforzar coherencia estilística.

En este workflow utilizamos:

Qué tocar:

  • LoRA cargado

  • strength del LoRA

Valores utilizados: (valores moderados ayudan a mantener equilibrio sin sobrecargar la imagen)

  • model strength: 0.65

  • clip strength: 0.65

Salida:

  • MODEL → KSampler

  • CLIP → CLIPTextEncode (+)

  • CLIP → CLIPTextEncode (–)


3️⃣ CLIPTextEncode (+) (prompt positivo)

Qué hace: define la identidad principal del personaje.

Prompt utilizado:

futuristic industrial female guardian, short free white hair, glowing blue energy core in chest, dark cobalt blue and pearl black full tactical sci-fi full armor, cyberpunk industrial style, full body, dark hacker atmosphere, dark factory background, detailed face, consistent character design, ultra detailed, realistic, high contrast

Qué tocar:

  • Prompt

  • Rasgos del personaje

  • Elementos icónicos

Salida:

  • CONDITIONING → ControlNetApplyAdvanced


4️⃣ CLIPTextEncode (–) (prompt negativo)

Qué hace: define errores y variaciones que queremos evitar.

Prompt negativo utilizado:

bad anatomy, bad hands, extra fingers, missing fingers, extra limbs, deformed body, distorted face, blurry, low quality, watermark, text, logo, different outfit, different hair color

Qué tocar:

  • Prompt negativo

Salida:

  • CONDITIONING → ControlNetApplyAdvanced


5️⃣ LoadImage (imagen de pose)

Qué hace: carga la imagen de referencia utilizada para controlar la postura del personaje.

En este workflow:

  • Pose_reference_fururisticIndustrialFemale_03.png (pero valdría cualquier imagen de la que se pudiera obtener una pose del personaje calra)

  • Esta imagen NO define identidad facial, sino que define postura, silueta y estructura corporal.

Qué tocar:

  • Imagen de pose. Cuanto más clara sea la pose mejor funcionará OpenPose.

Salida:

  • IMAGE → OpenPosePreprocessor


Captura de ComfyUI con una mujer futurista cargada, mapa OpenPose de cuerpo completo y nodos de ControlNet conectados.
Load Image, OpenPose Pose, Load ControlNet Model

6️⃣ OpenPosePreprocessor (detección corporal)

Qué hace: detecta automáticamente la estructura corporal de la imagen: caveza, torso, brazos, piernas y articulaciones. El resultado es una representación simplificada del esqueleto corporal.

Qué tocar:

  • resolución del preprocess

  • detección de manos/cara

En este workflow:

  • resolución: 768

Salida:

  • IMAGE → ControlNetApplyAdvanced

  • IMAGE → PreviewImage


7️⃣ PreviewImage (preview pose)

Qué hace: Permite visualizar el resultado del preprocess OpenPose.

Esto es MUY importante para comprobar:

  • si la pose se detecta correctamente

  • si faltan extremidades

  • si existe ruido estructural

Qué tocar:

  • Nada

Salida:

  • visualización del esqueleto OpenPose


8️⃣ ControlNetLoader (OpenPose ControlNet)

Qué hace: Carga el modelo ControlNet utilizado para interpretar la pose. Este modelo convierte la pose en una guía estructural para SDXL

Modelo utilizado:

Qué tocar:

  • modelo ControlNet cargado

Salida:

  • CONTROL_NET → ControlNetApplyAdvanced


9️⃣ ControlNetApplyAdvanced (control estructural)

Qué hace: Aplica el conditioning de OpenPose sobre el prompt y el modelo. Este nodo es uno de los más importantes del workflow.

aquí es donde:

  • la pose influye sobre el personaje

  • se estabiliza la estructura corporal

  • se mantiene coherencia de postura


Qué tocar:

  • strength

  • start

  • end

Valores utilizados: (Valores altos ayudan a mantener poses más consistentes)

  • strength: 0.85

  • start: 0

  • end: 0.9


Salida:

  • CONDITIONING → KSampler


Captura de ComfyUI con nodos KSampler, VAE Decode y Apply ControlNet; dos mujeres sci‑fi en traje blanco y azul en vista previa.
Apply ControlNet, Empty Latent Image, Ksampler. VAE Decode

🔟 EmptyLatentImage (resolución)

Qué hace: define el tamaño de la imagen generada.

  • En este workflow: 768 × 1152

    • Resolución vertical ideal para:

    • personajes completos

    • escenas cinematográficas

    • poses dinámicas

Qué tocar:

  • width (ancho)

  • Height (alto)

  • batch_size (numero de imágenes a generar)

Salida:

  • LATENT → KSampler


1️⃣1️⃣ KSampler (generación)

Qué hace: es el núcleo real del workflow. Aquí se combinan el modelo SDXL, el LoRA, la prompt, el OpenPose, ControlNet, Latent Image y Seed, y con todo esto se genera la imagen final.

Valores utilizados:

  • steps: 30

  • CFG: 6.5

  • sampler: euler

  • scheduler: normal


Qué tocar:

  • seed

  • CFG

  • steps

  • sampler


Salida:

  • LATENT → VAEDecode


1️⃣2️⃣ VAEDecode (decodificación)

Qué hace: convierte el resultado latente generado por el sampler en una imagen visible. Sin este nodo seguiríamos teniendo únicamente información matemática interna.

Qué tocar:

  • Nada

Salida:

  • IMAGE → SaveImage

  • IMAGE → PreviewImage


1️⃣3️⃣ SaveImage / PreviewImage (resultado final)

Qué hacen:

  • visualizar el resultado

  • guardar la imagen generada

Qué tocar:

  • nombre de guardado

  • organización de outputs

Salida:

  • imagen final generada


🎛️ Ajustes clave: cómo mejorar consistencia

Una de las partes más importantes cuando trabajas con consistencia de personajes no es simplemente construir el workflow. 👉 Lo realmente importante es aprender a equilibrar correctamente los parámetros.


⚡ 1. Prompt — el elemento más importante

El prompt es probablemente el factor más importante para mantener consistencia porque define identidad, ropa colores, atmósfera, rasgos visuales. En este workflow hemos utilizado elementos MUY reconocibles:

short white hair
glowing blue energy core
dark cobalt blue armor
cyberpunk industrial style

Cuando trabajes consistencia evita prompts excesivamente cambiantes. Si cambias continuamente ropa, o peinado, o colores, o estilo, el personaje empezará rápidamente a derivar visualmente.


🎨 2. LoRA — estabilidad estilística

El LoRA ayuda muchísimo porque introduce una interpretación visual relativamente estable. Valores moderados suelen funcionar mejor para consistencia.


Si el strength es demasiado alto:

  • el personaje puede deformarse

  • el estilo puede dominar demasiado

  • aumentan las variaciones visuales


💡 Valores recomendados

Strength

Resultado

0.3 – 0.5

influencia ligera

0.6 – 0.7

equilibrio ideal

0.8+

estilo dominante


🧍 3. OpenPose — estabilidad corporal

OpenPose es uno de los elementos más importantes del workflow porque mantiene postura, estructura y silueta corporal, y eso reduce muchísimo la sensación de “personaje distinto”.

Ajustes utilizados en este workflow:

Parámetro

Valor

strength

0.85

start

0

end

0.9

Un strength relativamente alto ayuda a mantener coherencia estructural.

Si el strength es excesivo:

  • la imagen puede volverse rígida

  • el personaje pierde naturalidad

  • aumenta sensación artificial

Especialmente en poses complejas.


🎲 4. Seed — estabilidad compositiva

La seed ayuda muchísimo a mantener la composición general, patrones visuales y distribución de elementos. Mantener la misma seed suele mejorar bastante la coherencia entre imágenes.

Puedes experimentar con:

Seed

Resultado

misma seed

más estabilidad

distinta seed

más variación

misma seed + distinta pose

buen equilibrio

Esto es especialmente interesante para storytelling.


⚡ 5. CFG — equilibrio entre creatividad y estabilidad

Más CFG:

  • sigue más el prompt

  • reduce libertad creativa

  • puede reforzar identidad

Pero también:

  • puede volver la imagen rígida

  • aumentar artefactos


💡 Valores recomendados

CFG

Resultado

4–5

más libertad

6–7

equilibrio ideal

8+

imagen más rígida

Para consistencia suelen funcionar bien valores medios.


⚡ 6. Steps — estabilidad visual

En este workflow utilizamos 30 steps, suficiente para buen detalle, estabilidad y coherencia facial.

Demasiados pocos steps pueden producir:

  • caras inconsistentes

  • detalles inestables

  • anatomía irregular


📐 7. Resolución — identidad vs detalle

En este workflow utilizamos: 768 × 1152

Más resolución:

  • más detalle

  • más calidad

  • más tiempo

  • más VRAM

Pero también:

  • puede aumentar drift visual

  • introduce más variaciones


🧪 Casos típicos y cómo corregirlos

Cuando empiezas a trabajar con consistencia de personajes aparecen problemas muy distintos a los workflows normales.

Caso

Qué ocurre

Causa probable

Solución

🔴 La cara cambia demasiado

El personaje parece otra persona

Prompt poco específico o seed distinta

Reforzar rasgos visuales

🔴 Cambia la ropa

La armadura o colores varían

Prompt insuficiente

Repetir elementos clave

🔴 Pose extraña

Anatomía poco natural

OpenPose mal detectado

Cambiar imagen de pose

🔴 Imagen rígida

Personaje artificial

ControlNet demasiado fuerte

Bajar strength

🔴 Drift visual

El personaje “deriva” poco a poco

Cambios excesivos entre imágenes

Mantener parámetros estables

🔴 Estilo inconsistente

Cambia iluminación o estética

LoRA demasiado bajo o prompt variable

Reforzar LoRA

🔴 Cara deformada

Rasgos inestables

Pocos steps o CFG extremo

Ajustar sampler

🔴 Resultados caóticos

Personaje irreconocible

Demasiados cambios simultáneos

Cambiar una sola variable


🔁 Qué puedes probar a continuación

Una vez que entiendes cómo funciona este workflow de consistencia de personajes, empieza la parte realmente interesante: experimentar de forma controlada.


La estrategia más recomendable suele ser:

1️⃣ mantener workflow estable

2️⃣ cambiar una sola variable

3️⃣ generar varias imágenes

4️⃣ comparar resultados

5️⃣ sacar conclusiones


🎨 Cosas que puedes probar

🧪 Prueba

⚙️ Qué hacer

👀 Qué vas a observar

🧍 Cambiar pose

Usar distintas imágenes OpenPose

Cómo cambia el personaje manteniendo identidad

🎲 Cambiar seed

Mantener todo igual y variar seed

Cambios compositivos y drift visual

🎨 Ajustar LoRA

Probar 0.4 / 0.6 / 0.8

Cómo cambia estabilidad estilística

⚡ Ajustar ControlNet

Probar 0.75 / 0.85 / 0.95

Diferencias en rigidez y coherencia corporal

📝 Simplificar prompt

Reducir detalles visuales

Pérdida de identidad y variaciones

🧠 Reforzar prompt

Añadir rasgos icónicos

Mayor reconocimiento del personaje

🌆 Cambiar escenario

Mantener personaje y variar fondo

Qué partes siguen siendo consistentes

📐 Cambiar resolución

Probar 768 / 1024

Impacto en detalle y estabilidad

⚙️ Cambiar sampler

Euler vs DPM++

Diferencias de coherencia visual

🎭 Cambiar expresión

Modificar emociones del personaje

Cómo afecta a percepción de identidad

👁️ Primer plano vs cuerpo completo

Variar cámara

Cambios en estabilidad facial

🔵 Cambiar LoRA

Probar otro estilo cyberpunk

Cómo influye el lenguaje visual


🗺️ Conclusión

En este artículo hemos entrado en uno de los problemas reales más importantes de la IA generativa: la consistencia de personajes.


Durante este workflow hemos combinado SDXL, OpenPose, ControNet, LoRA y prompts para mantener identidad visual entre múltiples imágenes. Y aunque todavía no existe una consistencia perfecta, el resultado ya permite construir personajes sorprendentemente coherentes.


Probablemente el aprendizaje más importante es que la consistencia no depende de una sola herramienta. Depende del equilibrio entre prompt, estilo, estructura, composición, pose y elementos visuales repetidos. Todos esos elementos trabajan juntos.


Durante el artículo hemos visto cómo:

  • OpenPose ayuda a mantener estructura corporal

  • LoRA estabiliza el lenguaje visual

  • el prompt refuerza identidad

  • la seed mejora coherencia compositiva

  • los elementos icónicos ayudan muchísimo al reconocimiento


En el siguiente artículo añadiremos algo completamente nuevo: referencia visual directa, y ahí entraremos en IPAdaper, identidad visual mucho más estable y consistencia facial reforzada, porque una vez entiendes cómo funciona la consistencia “manual”, IPAdapter deja de ser magia y empieza a tener sentido técnico real.


Si quieres seguir aprendiendo a dominar la IA en local y construir workflows realmente útiles:


🌐 Recursos útiles



Comentarios


© 2025 by Lozkorp                                                         

bottom of page