Generación avanzada de imágenes

Esta guía da por leídos los conceptos básicos y no los repetirá.

Lo más importante que hay que saber antes de seguir: Soulkyn hace correr dos familias de modelo de imagen, y casi todo lo que viene abajo se aplica solo a una de ellas. Los modelos SD (SD - Anime Original, SD - Anime Alpha, SD - Anime Hyper) están basados en Stable Diffusion: toman prompts de etiquetas y exponen pesos, schedulers, CFG y CLIP skip. Los modelos de lenguaje natural (SK-Alpha, ZIT - Sk-All, ZIT - Sk-Photo, ZIT - Sk-Real) toman frases normales y tienen un interruptor Force Style en lugar de la mayoría de esos controles.

Por eso la página abre con la familia de lenguaje natural, luego cubre a fondo el panel SD, los pesos, la estilización, los presets y la anatomía de un prompt, y cierra con la edición de imagen con IA.

Los modelos de lenguaje natural: SK-Alpha y ZIT

Cuatro de los siete modelos — SK-Alpha, ZIT - Sk-All, ZIT - Sk-Photo y ZIT - Sk-Real — no quieren etiquetas en absoluto. Escribe una frase, como le describirías la imagen a alguien que está a punto de pintarla.

Qué cambia

  • Sin sintaxis de pesos. +, - y :2 no son un idioma aquí. El énfasis sale de lo que eliges decir y de cómo ordenas la frase, igual que al escribir normal.
  • Sin CFG, sin CLIP skip, sin scheduler. Todo ese panel pertenece a la familia SD. No falta nada: esos mandos simplemente no tienen equivalente.
  • Force Style en su lugar. Un subinterruptor Realistic / Anime que fija el estilo diga lo que diga el prompt. Es el control al que recurrir cuando un modelo se va hacia el aspecto equivocado: mucho más fiable que discutir con él en prosa.
  • Más sitio. 1.400 caracteres de prompt en vez de 550, y hasta cuatro LoRAs en vez de tres.
  • La referencia de rostro está en ambas familias de lenguaje natural: es la forma práctica de mantener reconocible a un personaje a lo largo de una serie.

Cómo elegir

SK-Alpha es el especialista de la clase realista y solo aparece en kyns de esa familia; en los puramente anime queda oculto. No tiene img2img. ZIT - Sk-All es el generalista amplio, ZIT - Sk-Photo tira a lo fotográfico, ZIT - Sk-Real al realismo, y los tres aceptan img2img: pega un enlace de imagen de Soulkyn como base y el modelo parte de ahí.

Cómo promptearlos bien

  • Describe el encuadre, no una lista de sustantivos. Dónde está el sujeto, qué hace, dónde está la cámara, qué hace la luz.
  • Una frase clara gana a cinco cláusulas contradictorias. Si el resultado sale confuso, el prompt suele estarlo también.
  • Cambia una cosa por intento. Reescribir la frase entera no te dice qué movió el resultado.
  • Fija el estilo con Force Style, no con adjetivos peleando contra el default del modelo.

Todo desde aquí hasta el final de «Problemas comunes» trata de la familia SD. Los pesos, los schedulers, el CLIP skip y el CFG no existen en SK-Alpha ni en los modelos ZIT: allí describe lo que quieres en una frase y usa Force Style. Una corrección de paso: las franjas de CFG descritas abajo son teoría general, pero el control de Fuerza del prompt de Soulkyn va de 5,5 a 11, con 7,5 por defecto. Lee esas franjas como algo relativo, no como el rango que vas a ver.

Configuración avanzada

Advanced settings panel

Capas

Las capas son "bloques" que componen un modelo de imagen. Piensa en Stable Diffusion como una torre hecha de pisos - cada "bloque" tiene su propio trabajo:

  • Capas tempranas - Capturan detalles de bajo nivel (bordes, colores, texturas)
  • Capas medias - Capturan patrones y formas (caras, ropa, estructura corporal)
  • Capas tardías - Capturan significado semántico (conceptos como "gato" vs "perro" o "estilo anime" vs "foto")

LoRA

Los LoRAs son métodos de entrenamiento para ajustar modelos grandes. Cuando tienes un modelo de imagen, los LoRAs le enseñan nuevos trucos inyectándose en ciertas capas - como remodelar pisos específicos en la torre.

CLIP Skip Layers

Stable Diffusion usa CLIP (Contrastive Language-Image Pre-training) como codificador de texto para convertir tu prompt en embeddings. CLIP es básicamente un traductor entre tú y el modelo de imagen. Saltar capas corta la comprensión de alto nivel.

Muchos modelos anime y LoRAs están entrenados con valores de CLIP skip en mente (más frecuentemente 2). Saltar una capa podría darte resultados más tipo anime o estilizados.

Scheduler

El scheduler controla el proceso de denoising durante la generación. Afecta fuertemente la nitidez de la imagen, coherencia, y adherencia al prompt.

Euler a - Fast

  • Produce imágenes nítidas y detalladas con fuerte contraste
  • Excelente para anime, arte estilizado, o detalles tipo boceto
  • A veces inestable con realismo - puede distorsionar texturas finas o caras
  • Cuándo usar: Resultados rápidos, creativos y detallados para estilo anime o arte conceptual
Euler a example

DPM++ SDE Karras

  • Produce gradientes suaves de alta calidad y transiciones suaves
  • Excelente para detalles más pequeños
  • Cada renderizado sale diferente - bueno para variación orgánica
  • Cuándo usar: Renderizados fotorrealistas, iluminación natural, estilos pictóricos, transiciones suaves
DPM++ SDE Karras example

DPM++ 2M - Deterministic

  • Produce resultados suaves y consistentes con alta fidelidad al prompt
  • Buen balance entre velocidad y precisión
  • Cuándo usar: Realismo, retratos, estilos consistentes donde la estabilidad importa
DPM++ 2M example

DPM++ 2M Karras

  • Produce gradientes más suaves, mejor textura, y mayor fidelidad de detalle que el DPM++ 2M vanilla
  • Ligeramente más lento que Euler A, pero mayor calidad para realismo
  • Cuándo usar: Imágenes fotorrealistas, retratos, texturas complejas - mejor para apariencia pulida y estable
DPM++ 2M Karras example

Prompt Strength

Prompt strength cambia la escala CFG - cuanto mayor el valor, más el sistema sigue tu prompt de imagen.

  • CFG Bajo (1-5): El modelo presta menos atención al prompt. Más libertad artística, composiciones más oníricas. Riesgo: La imagen se desvía de lo que pediste.
  • CFG Medio (6-9): Adherencia balanceada vs creatividad. Punto dulce común: 7-8. Mantiene tanto precisión como estética.
  • CFG Alto (10+): Fuerte adherencia a palabras clave. Puede volverse sobresaturado, áspero, o "quemado". Riesgo: Artefactos extraños, imágenes rígidas o no naturales.

Pesos

El peso real de + es 1.1^x (donde x = número de +). Mientras tanto - es 0.9^x.

# de signosPeso de -Peso de +
10.91.1
20.811.21
30.7291.331
40.65611.4641
50.590491.61051
60.5314411.771561

ADVERTENCIA: ¡ESTA TABLA NO ES UNA TABLA MATEMÁTICA! ¡ES UNA REPRESENTACIÓN VISUAL DEL RESULTADO FINAL!

Puedes engañar al sistema: (keyword-)2 da el equivalente de (keyword)1.8. Más complejo: (keyword---)2 se calcula como (keyword 0.9^3)2 = 0.729 * 2 = (keyword)1.458

Estilización

Las combinaciones de palabras clave y pesos pueden lograr ciertas apariencias deseadas. Ejemplo con painterly_shading:

Con Painterly_shading+++Sin
Painterly shading exampleWithout stylization

Puedes cambiar:

  • Estilo / Estilización - Apariencia general
  • Sombreado / Iluminación - Volumen y profundidad
  • Line-art - Definición de bordes
  • Proporciones - Cómo se representan los sujetos
  • Textura / Detalle - Detalles de superficie
  • Composición / Encuadre - Arreglo
  • Simulación - Qué medio simula la imagen
  • Calidad - Calidad general

Preajustes y físicos

En los modelos SD el prompt de imagen tiene un tope de 550 caracteres, que no es mucho en cuanto metes etiquetas de calidad, una pose, un ángulo de cámara y un ambiente. Los presets son la forma de sortearlo: los presets de fondo, ropa y prompt llevan sus propias etiquetas y no gastan tus 550.

Los límites reales

  • Presets de ropa: hasta 18 etiquetas, 38 caracteres por etiqueta.
  • Presets de fondo y de prompt: hasta 35 etiquetas, 50 caracteres por etiqueta.
  • El prompt de imagen en sí: 550 caracteres en modelos SD, 1.400 en los de lenguaje natural, donde todo este empaquetado de presets ni siquiera hace falta.

Trucos para empaquetar

  • Usa puntos y coma ; para meter varios significados afines en una sola etiqueta.
  • Usa guiones bajos _ para soldar palabras en un concepto que el modelo lee como una sola cosa.
  • Usa :2 para más peso: está normalizado, no te va a reventar la imagen.

Ejemplo trabajado: un personaje al estilo PaintFuka

Physical tags: Painterly; Soft; No_lineart, 8K;16K; Hdr, Blue Lips, Slim Eyebrows; Fair_skin:2, Long Two-Toned Dark_blue Hair, Realistic_character_anatomy, High Quality, Highest_quality; Extremely_detailed, Adult_woman:2; Mature_woman:2, Realistic Details, Painterly Texture, Cute;Kawaii, Digital_painting:2, Thick Thighs; Slim Waist, High Contrast, Painterly Details, Long Blue Hair; Blue Eyes, Dramatic; Epic; Emotional

Clothing tags: Hyperdetailed_eyelashes, High_contrast:2; Shadows:2; Light:2, Realistic:2; Anime:2, Canvas_tone_texture; Hyperdetailed, Hyperdetailed_skin:2, Expressive;Hyperrealistic:2, Hyperdetailed_body:2; Cute:2, Glow_diffusion; Saturated_colors:2, Hyperdetailed_shading, Hyperdetailed_textures:2, Hyperdetailed_hair, Glowing_eyes:2; Big_eyes:2, Hyperdetailed_clothing:2, Hyperdetailed_eyes:2, Art Bloom; Soft; Hard; Hairstrands, Painterly_skin_softness; Kawaii:2;, Soft Light; Thick Thighs; Matte_skin:2, Realistic Anime; Soft Shading

Background: Glowing Highlights, Detailed Rendering, Vibrant Colors, Saturated Colors, Ambient Lighting, Anime Art Style, Cell Shading, Rim Lighting, Digital Painting, Semi-Realistic, Soft Shading, Smooth Gradients, Dramatic Lighting, Polished Finish, Professional Artwork, Clean Lineart, High Contrast, Artstation Quality; Highest Quality

PaintFuka example

Leyendo parte de los rasgos físicos:

  • Painterly — más detalle pictórico
  • Soft — imagen más suave
  • No_lineart — sin línea (funciona como un negativo)
  • 8k; 16k / High Quality — pidiendo calidad muy alta
  • Hdr — más contraste entre luces y sombras
  • Blue lips — el personaje tiene los labios azules
  • Fair_skin:2 — la piel clara va en serio
  • Long Two-Toned Dark_blue Hair — pelo largo en dos tonos de azul
  • Realistic_character_anatomy — anatomía realista

Anatomía de un prompt avanzado

¡Es hora de usar todo nuestro conocimiento recién adquirido para ser más creativos con nuestros prompts! Para esto usaremos el Fondo y Ropa de PaintFuka.

Aquí hay una comparación entre prompts no estilizados y uno estilizado:

No estilizadoEstilizado
Not stylizedStylized

Primero describamos una imagen que queremos crear:

  • Cantidad de personas: 1
  • Perspectiva: cowboy shot (perspectiva desde las rodillas hacia arriba)
  • Personaje vistiendo un vestido de verano blanco
  • Personaje está corriendo mientras extiende una mano
  • Expresión: Sonriendo
  • Fondo: No importante, puede ser borroso para hacer destacar al personaje
  • Calidad: Extremadamente detallada, ilustración realista

Tomando esta lista en cuenta, preparemos todos los loras, scheduler, y palabras clave.

¡Porque queremos que la imagen se asemeje a una ilustración realista detallada, usemos LoRAs justo para eso!

Aquí está el resultado de aplicar los LoRAs Micro / Fine details :6 y Realistic Illustration :6:

Con LoRAsSin LoRAs
With LoRAsWithout LoRAs

¡Ahora pongámosle ropa y hagámosla correr!

Prompt final:

Configuraciones avanzadas:

  • LoRA: Micro / Fine details :6, Realistic Illustration :6
  • Prompt Strength: 11.0
  • CLIP Skip: 2
  • Scheduler: DPM++ 2M
  • Image Orientation: Landscape
  • Seed: Random
  • Prompt: Portrait
  • Background: PaintFuka
  • Clothes: PaintFuka
  • Image Prompt: (solo, alone)+++, (macro_detail, clean_composition, color_balance, 8k_realistic_render, professional_product_shot)+++, (close, cowboy_shot)++++, (white_summer_dress---)2, (running)+++, (reaching_out, one_hand, outstretched_hand)+++, (smiling, Happy, open_mouth, closed_eyes)+, (blurry_background--)2

Resultado final:

Final result

Ahora analicemos qué entró en el prompt y cómo funciona:

  • (solo, alone)+++ - hace que el personaje aparezca solo en la imagen
  • (macro_detail, clean_composition, color_balance, 8k_realistic_render, professional_product_shot)+++ - estos le dicen a la IA sobre la calidad de la imagen que queremos obtener
  • (close, cowboy_shot)++++ - Esto le dice a la IA que queremos un cowboy shot realmente cercano
  • (white_summer_dress---)2 - Esto fuerza a la IA a darle a nuestro personaje un vestido de verano blanco
  • (running)+++ - Esto le dice a la IA que queremos que nuestro personaje esté corriendo
  • (reaching_out, one_hand, outstretched_hand)+++ - Esto le dice precisamente a la IA qué tipo de pose queremos
  • (smiling, Happy, open_mouth, closed_eyes)+ - Esto define la expresión de nuestro personaje
  • (blurry_background--)2 - Esto fuerza a la IA a darnos un fondo borroso

Como extra, este es el efecto de agregar solo un LoRA más:

Effect of adding one more LoRA

Problemas comunes

El problema más común es la degradación de calidad - algunos usuarios llaman a esto "carpetización" porque las imágenes rotas se ven como primeros planos de superficie de alfombra.

Esto es muy probablemente debido a:

  • Demasiado peso
  • Demasiada fuerza en los LoRAs
  • Etiquetas en conflicto

Edición de imagen con IA

Editar una imagen existente es una herramienta aparte de la generación, y es el único sitio de la plataforma donde hablas al modelo en frases normales, sea cual sea el modelo que hizo la imagen.

Cómo llegar

  1. Abre la galería de un kyn
  2. Elige la imagen que quieres cambiar
  3. Pulsa EDIT IMAGE
Interfaz de edición de imagen

Cómo escribir la instrucción

Frases descriptivas, no etiquetas. Di qué debe cambiar: «Cambia el pelo del personaje a blanco y oscurece su piel.» Tienes hasta 2.500 caracteres de instrucción y un control de Número de variaciones si quieres varios intentos a la vez.

Ejemplo de resultado de edición

Presets de estilo

Además de la edición simple hay trece mejoras de estilo: None (Standard Edit), Caricature, Next Scene, Photo to Anime, Balloon Inflate, Object Remover, Object Adder, Polaroid Photo, Camera Angle Change, Futanarify, To Realistic Photo, Upscale Quality y 18+ Mode.

Dos cosas antes de empezar

  • Los resultados quedan en revisión. Las ediciones generadas caducan a los 30 minutos si no las confirmas: marca las que quieras borrar, o elige la que te quedas, y confirma.
  • El modelo de edición no está entrenado en contenido adulto. Lo dice la propia app: puedes intentarlo, pero lo más probable es que falle. La generación no está censurada; la edición no es la misma herramienta ni lleva la misma promesa.

La edición de imagen requiere Premium.

Sigue explorando

Las páginas que se leen después.