Conceptos básicos de ComfyUI: Una guía sencilla para principiantes

Posted on July 30, 2025 - Tutorials

comfyui basics

¡Hola! ¿Te sientes perdido en el mundo de ComfyUI? No te preocupes. Yo también estuve ahí, y estoy aquí para aclarártelo.

¿Qué onda con los UNETs?

Los UNETs son como el cerebro de ComfyUI. Son el modelo principal que hace que la magia suceda.

Piensa en un UNET como un artista súper inteligente. Le das una idea y te pinta una imagen. Pero en lugar de usar pinceles, usa matemáticas. ¡Alucinante, verdad?

Lo mejor de todo es que los UNETs son muy buenos aprendiendo con solo unos pocos ejemplos. Es como si tuvieran una memoria fotográfica para estilos de arte.

La forma de un UNET se asemeja a una “U” (sorpresa, lo sé). Esta forma le ayuda a recordar tanto el panorama general como los detalles más pequeños cuando crea una imagen.

VAEs: Los compresores de imagen

VAE significa Variational AutoEncoder, pero olvídate de ese palabro: vamos a llamarlos “aplastadores de imagen”.

Estos toman tu imagen grande y detallada y la comprimen en algo llamado “espacio latente”. Es como convertir una hamburguesa gigante en una pequeña slider.

Ojo: este proceso de compresión no es perfecto. Puede que pierdas un pepinillo por el camino. Por eso decimos que es “con pérdida” (lossy).

Consejo pro: No vuelvas loco el proceso intercambiando una y otra vez entre imágenes grandes y comprimidas. Es como aplastar y des-aplastar la hamburguesa todo el tiempo: desordenado y fatal para la calidad.

CLIP: Tu traductor de texto a imagen

CLIP es como ese amigo que describe todo a la perfección. Le dices lo que quieres y convierte tus palabras en algo que el UNET pueda entender.

Un truco genial: las palabras al inicio de tu prompt tienen más peso. Así que si de verdad quieres una bufanda roja, pon “bufanda roja” al principio.

Incluso puedes ajustar cuánto “escucha” CLIP de cada parte de tu prompt. Es como subir el volumen a ciertas palabras.

Tensores: Los bloques de construcción

Vale, esto suena algo técnico, pero sigue conmigo. Los tensores son simplemente “un montón de números organizados de una manera específica”.

En ComfyUI, casi todo es un tensor: imágenes, prompts, lo que sea.

¿Quieres ver cómo es un tensor? Usa la herramienta Tensor Shape Debug. Te aparecerá algo como [[1,768,512,3]]. ¡No te asustes! Solo te dice el tamaño y la forma de tu imagen.

Checkpoints: El pack todo en uno

¿Has pedido alguna vez un menú combinado? Pues eso es un checkpoint en ComfyUI. Incluye tu UNET, CLIP y VAE todo junto y ordenado.

Imagínatelo así: tu hamburguesa (UNET), tus patatas (CLIP) y tu bebida (VAE) en un mismo combo. ¡Ñam!

Lo divertido es que no tienes que “comerte” todo junto. ComfyUI te permite usar nodes de carga para quedarte solo con lo que necesitas. Es como pedir solo las patatas si es lo único que te apetece.

Espacio Latente: La pistola de encoger

Imagina que tienes una foto enorme y detallada de tu perro. El espacio latente es como darle un rayo encogedor: terminas con una versión pequeñita que sigue pareciéndose a tu perro, aunque quizá las orejas le queden algo chuecas.

Este “encogimiento” lo hace nuestro amigo VAE (recuerda al aplastador de imágenes). No es perfecto: igual pierdes algún detalle, como el patrón exacto de sus manchas.

Tip pro: Cuando trabajes con imágenes en ComfyUI, usa tamaños que se dividan bien entre 8. ¿Por qué? Porque al VAE le gusta dividir todo por 8; si tus números no encajan, los resultados pueden salir raros.

Condicionamiento de Prompt: Tu cóctel de ideas

Hablemos de condicionamiento de prompt. Es como ser bartender, pero en lugar de mezclar copas, mezclas ideas para tu imagen.

Tienes tres maneras de mezclar:

  1. Concat (concatenar): como poner capas de cóctel sin mezclar, una idea tras otra.
  2. Combine: como hacer mini-cócteles por separado y luego verterlos juntos.
  3. Average (promediar): imagina licuar todos los ingredientes y servir un trago homogéneo.

Cada método da un “sabor” diferente a la imagen final. ¡Prueba y decide cuál te gusta más!

Rango de Condicionamiento Temporal: La herramienta del viajero del tiempo

Esto es una pasada. Imagina controlar cuándo entran ciertas partes de tu prompt durante el proceso de creación.

Digamos que quieres una aldea que pase de primavera a invierno. Podrías decirle a ComfyUI: “usa el prompt ‘aldea primaveral’ para el 20 % inicial del proceso, y luego cambia a ‘aldea invernal’ para el resto.”

Es como ser viajero del tiempo y controlador del clima a la vez. ¡Muy guay!

Resolución de Entrenamiento del Modelo: El tamaño importa

Cada modelo de IA es como una tele distinta: está optimizado para un tamaño específico.

Por ejemplo, SDXL es como un televisor 4K: está entrenado para trabajar mejor con imágenes de 1024×1024 píxeles. Usarlo con resoluciones más pequeñas es como ver cintas VHS en tu nueva tele: funciona, pero no luce al máximo.

¿Quieres probar opciones? Ajusta tu seed a 0. Es como darle al shuffle en tu reproductor de música: obtendrás una mezcla aleatoria cada vez.

Samplers y Schedulers: El dúo dinámico

Samplers y schedulers son como el director y los músicos de una orquesta. Juntos crean tu imagen final.

No existe un “mejor” sampler o scheduler: depende de qué tipo de “música” (imagen) busques. Pero Karras es muy popular, como ese hit que todos conocen.

Hay dos tipos de samplers:

  1. Predecibles (euler, dpmpp_2m, ddim, uni_pc): como música clásica, estructurada y constante.
  2. Estocásticos: más tipo jazz, con toques de aleatoriedad. Perfectos si quieres un resultado con vidilla.

Si empiezas, prueba estos:

  • Schedulers: karras, exponential, sgm_uniform, normal
  • Samplers: euler, dpmpp_2m, uni_pc, dmpp_2m_sde_ddpm, dpm_adaptive

¡Mezcla y combina hasta encontrar tu dúo perfecto!

Steps: El juego de la paciencia

Los steps en ComfyUI equilibran calidad y velocidad. Más steps = mejor calidad, pero más lento. Menos steps = rápido, pero quizá un poco toscote.

Es como cocinar un guiso: podrías comerlo en 10 min, pero si lo dejas cocer una hora… ¡la magia sucede!

Recuerda: ComfyUI no “crea” la imagen de la nada. Más bien, va quitando el ruido como esculpiendo una estatua, al igual que decía Miguel Ángel: la imagen ya está dentro, solo falta liberarla.

CFG: El copiloto mandón

CFG (Classifier-Free Guidance) es como un copiloto muy directivo. Un CFG alto es un navegador que te da órdenes: “gira ahora a la izquierda”. CFG bajo es más “a tu aire”, como un colega relajado.

  • CFG alto: “¡Ahora GIRA, NO TU OTRO IZQUIERDA!”
  • CFG bajo: “Bah, haz lo que te parezca.”

Usa CFG alto para cosas muy específicas, como imágenes de producto. CFG bajo para explorar ideas locas.

Semilla Aleatoria (Seed): El número mágico

La semilla aleatoria es el código secreto que genera una imagen concreta. Si usas la misma seed, prompt y opciones, obtendrás la misma imagen cada vez.

Muy útil para ir ajustando sin perder el rollo original. ¿Te gusta algo pero quieres cambiar un detalle? Mantén la misma seed y listo.


¡Uf! Esto es bastante info básica de ComfyUI. Pero no te agobies si no lo pillas todo a la primera. Lo mejor es lanzarte, experimentar y jugar. Antes de que te des cuenta, estarás creando imágenes alucinantes y pensando cómo viviste sin ComfyUI.

Preguntas Frecuentes

P: ¿Necesito entender todo esto para usar ComfyUI? R: No, ¡pero ayuda! Empieza a trastear y lo irás pillando sobre la marcha.

P: ¿Cuál es el mejor sampler? R: No hay uno “mejor”: depende de tu objetivo. Pero Karras es bastante popular.

P: ¿Cuántos steps debería usar? R: Más steps = mejor calidad pero más lento. Empieza con 20 y ajusta a tu gusto.


Si tienes feedback, escríbenos a [email protected].

Loading...
Loading...