Génération d'images avancée

Ce guide suppose que vous avez lu les bases et ne les répétera pas.

La chose la plus importante à savoir avant d'aller plus loin : Soulkyn fait tourner deux familles de modèles d'image, et presque tout ce qui suit ne concerne que l'une d'elles. Les modèles SD (SD - Anime Original, SD - Anime Alpha, SD - Anime Hyper) reposent sur Stable Diffusion — ils prennent des prompts en tags et exposent poids, schedulers, CFG et CLIP skip. Les modèles en langage naturel (SK-Alpha, ZIT - Sk-All, ZIT - Sk-Photo, ZIT - Sk-Real) prennent des phrases normales et disposent d'un réglage Forcer le style à la place de la plupart de ces contrôles.

La page commence donc par la famille en langage naturel, puis couvre en profondeur le panneau SD, les poids, la stylisation, les préréglages et l'anatomie d'un prompt, et se termine par l'édition d'image par IA.

Les modèles en langage naturel : SK-Alpha et ZIT

Quatre des sept modèles — SK-Alpha, ZIT - Sk-All, ZIT - Sk-Photo et ZIT - Sk-Real — ne veulent pas de tags du tout. Écrivez une phrase, comme vous décririez l'image à quelqu'un qui s'apprête à la peindre.

Ce qui change

  • Pas de syntaxe de poids. +, - et :2 ne sont pas une langue ici. L'insistance vient de ce que vous choisissez de dire et de l'ordre de la phrase, exactement comme dans l'écriture ordinaire.
  • Ni CFG, ni CLIP skip, ni scheduler. Tout ce panneau appartient à la famille SD. Rien ne manque : ces réglages n'ont simplement pas d'équivalent.
  • Forcer le style à la place. Un sous-réglage Réaliste / Anime qui fixe le rendu quoi que dise le prompt. C'est le contrôle à utiliser quand un modèle dérive vers le mauvais rendu — bien plus fiable que de se disputer avec lui en prose.
  • Plus de place. 1 400 caractères de prompt au lieu de 550, et jusqu'à quatre LoRA au lieu de trois.
  • La référence de visage est disponible sur les deux familles en langage naturel : c'est la manière pratique de garder un personnage reconnaissable d'une image à l'autre.

Comment choisir

SK-Alpha est le spécialiste de la classe réaliste et n'apparaît que sur les kyns de la famille réaliste — il est masqué sur les kyns purement anime. Il n'a pas d'img2img. ZIT - Sk-All est le généraliste, ZIT - Sk-Photo penche vers le photographique, ZIT - Sk-Real vers le réalisme, et les trois acceptent l'img2img : collez un lien d'image Soulkyn comme base et le modèle part de là.

Bien les prompter

  • Décrivez le cadre, pas une liste de noms. Où est le sujet, ce qu'il fait, où est la caméra, ce que fait la lumière.
  • Une phrase claire vaut mieux que cinq propositions contradictoires. Si le résultat est confus, le prompt l'est en général aussi.
  • Changez une chose par essai. Réécrire toute la phrase ne vous apprend rien sur ce qui a bougé.
  • Fixez le style avec Forcer le style, pas avec des adjectifs qui luttent contre le défaut du modèle.

Tout ce qui suit, jusqu'à la fin de « Problèmes courants », concerne la famille SD. Les poids, les schedulers, le CLIP skip et le CFG n'existent pas sur SK-Alpha ni sur les modèles ZIT — pour ceux-là, décrivez ce que vous voulez en une phrase et utilisez Forcer le style. Une correction au passage : les plages de CFG décrites ci-dessous relèvent de la théorie générale, mais le curseur Force du prompt de Soulkyn va de 5,5 à 11, avec 7,5 par défaut. Lisez ces plages comme des ordres de grandeur relatifs, pas comme l'échelle que vous verrez.

Paramètres avancés

Advanced settings panel

Couches

Les couches sont des "blocs" qui constituent un modèle d'image. Pensez à Stable Diffusion comme une tour composée d'étages - chaque "bloc" a son propre rôle :

  • Couches précoces - Capturent les détails de bas niveau (contours, couleurs, textures)
  • Couches intermédiaires - Capturent les motifs et les formes (visages, vêtements, structure corporelle)
  • Couches tardives - Capturent le sens sémantique (concepts comme "chat" vs "chien" ou "style anime" vs "photo")

LoRA

Les LoRAs sont des méthodes d'entraînement pour affiner les grands modèles. Lorsque vous avez un modèle d'image, les LoRAs lui apprennent de nouveaux tours en s'injectant dans certaines couches - comme rénover des étages spécifiques dans la tour.

CLIP Skip Layers

Stable Diffusion utilise CLIP (Contrastive Language-Image Pre-training) comme encodeur de texte pour convertir votre prompt en embeddings. CLIP est essentiellement un traducteur entre vous et le modèle d'image. Sauter des couches coupe la compréhension de haut niveau.

De nombreux modèles anime et LoRAs sont entraînés avec des valeurs de CLIP skip en tête (le plus souvent 2). Sauter une couche peut vous donner des résultats plus anime ou stylisés.

Scheduler

Le scheduler contrôle le processus de débruitage pendant la génération. Il affecte fortement la netteté de l'image, la cohérence et l'adhérence au prompt.

Euler a - Rapide

  • Produit des images nettes et détaillées avec un contraste fort
  • Idéal pour l'anime, l'art stylisé ou les détails type croquis
  • Parfois instable avec le réalisme - peut déformer les textures fines ou les visages
  • Quand l'utiliser : Sorties rapides, créatives et détaillées pour le style anime ou l'art conceptuel
Euler a example

DPM++ SDE Karras

  • Produit des dégradés lisses de haute qualité et des transitions douces
  • Excellent pour les petits détails
  • Chaque rendu sort différemment - bon pour les variations organiques
  • Quand l'utiliser : Rendus photoréalistes, éclairage naturel, styles picturaux, transitions douces
DPM++ SDE Karras example

DPM++ 2M - Déterministe

  • Produit des résultats lisses et cohérents avec une haute fidélité au prompt
  • Bon équilibre entre vitesse et précision
  • Quand l'utiliser : Réalisme, portraits, styles cohérents où la stabilité compte
DPM++ 2M example

DPM++ 2M Karras

  • Produit des dégradés plus lisses, une meilleure texture et une fidélité de détail plus élevée que le DPM++ 2M vanilla
  • Légèrement plus lent qu'Euler A, mais qualité supérieure pour le réalisme
  • Quand l'utiliser : Images photoréalistes, portraits, textures complexes - idéal pour un aspect poli et stable
DPM++ 2M Karras example

Force du prompt

La force du prompt modifie l'échelle CFG - plus la valeur est élevée, plus le système suit votre prompt d'image.

  • CFG bas (1-5) : Le modèle prête moins attention au prompt. Plus de liberté artistique, compositions plus oniriques. Risque : l'image dérive de ce que vous avez demandé.
  • CFG moyen (6-9) : Adhérence équilibrée vs créativité. Point idéal commun : 7-8. Maintient à la fois précision et esthétique.
  • CFG élevé (10+) : Forte adhérence aux mots-clés. Peut devenir sursaturé, dur ou "brûlé". Risque : artefacts étranges, images rigides ou non naturelles.

Poids

Le poids réel de + est 1,1^x (où x = nombre de +). Pendant ce temps - est 0,9^x.

Nb de signesPoids de -Poids de +
10,91,1
20,811,21
30,7291,331
40,65611,4641
50,590491,61051
60,5314411,771561

AVERTISSEMENT : CE TABLEAU N'EST PAS UN TABLEAU MATHÉMATIQUE ! C'EST UNE REPRÉSENTATION VISUELLE DU RÉSULTAT FINAL !

Vous pouvez jouer avec le système : (keyword-)2 donne l'équivalent de (keyword)1.8. Plus complexe : (keyword---)2 se calcule comme (keyword 0.9^3)2 = 0.729 * 2 = (keyword)1.458

Stylisation

Les combinaisons de mots-clés et de poids peuvent obtenir certains looks désirés. Exemple avec painterly_shading :

Avec Painterly_shading+++Sans
Painterly shading exampleWithout stylization

Vous pouvez changer :

  • Style / Stylisation - Aspect général
  • Ombrage / Éclairage - Volume et profondeur
  • Trait - Définition des contours
  • Proportions - Comment les sujets sont représentés
  • Texture / Détail - Détails de surface
  • Composition / Cadrage - Agencement
  • Simulation - Quel medium l'image simule
  • Qualité - Qualité globale

Préréglages et physiques

Sur les modèles SD, le prompt d'image est plafonné à 550 caractères — ce qui est peu dès qu'on y met des tags de qualité, une pose, un angle de caméra et une ambiance. Les préréglages servent à contourner cela : les préréglages de décor, de vêtements et de prompt portent leurs propres tags sans consommer vos 550 caractères.

Les vraies limites

  • Préréglages de vêtements : jusqu'à 18 tags, 38 caractères par tag.
  • Préréglages de décor et de prompt : jusqu'à 35 tags, 50 caractères par tag.
  • Le prompt d'image lui-même : 550 caractères sur les modèles SD, 1 400 sur les modèles en langage naturel — où tout ce bourrage de préréglages n'a de toute façon pas lieu d'être.

Astuces de compression

  • Utilisez des points-virgules ; pour tasser plusieurs sens voisins dans un seul tag.
  • Utilisez des underscores _ pour souder des mots en un concept unique que le modèle lit d'un bloc.
  • Utilisez :2 pour un poids plus fort — c'est normalisé, l'image n'explosera pas.

Exemple travaillé : un personnage façon PaintFuka

Physical tags: Painterly; Soft; No_lineart, 8K;16K; Hdr, Blue Lips, Slim Eyebrows; Fair_skin:2, Long Two-Toned Dark_blue Hair, Realistic_character_anatomy, High Quality, Highest_quality; Extremely_detailed, Adult_woman:2; Mature_woman:2, Realistic Details, Painterly Texture, Cute;Kawaii, Digital_painting:2, Thick Thighs; Slim Waist, High Contrast, Painterly Details, Long Blue Hair; Blue Eyes, Dramatic; Epic; Emotional

Clothing tags: Hyperdetailed_eyelashes, High_contrast:2; Shadows:2; Light:2, Realistic:2; Anime:2, Canvas_tone_texture; Hyperdetailed, Hyperdetailed_skin:2, Expressive;Hyperrealistic:2, Hyperdetailed_body:2; Cute:2, Glow_diffusion; Saturated_colors:2, Hyperdetailed_shading, Hyperdetailed_textures:2, Hyperdetailed_hair, Glowing_eyes:2; Big_eyes:2, Hyperdetailed_clothing:2, Hyperdetailed_eyes:2, Art Bloom; Soft; Hard; Hairstrands, Painterly_skin_softness; Kawaii:2;, Soft Light; Thick Thighs; Matte_skin:2, Realistic Anime; Soft Shading

Background: Glowing Highlights, Detailed Rendering, Vibrant Colors, Saturated Colors, Ambient Lighting, Anime Art Style, Cell Shading, Rim Lighting, Digital Painting, Semi-Realistic, Soft Shading, Smooth Gradients, Dramatic Lighting, Polished Finish, Professional Artwork, Clean Lineart, High Contrast, Artstation Quality; Highest Quality

PaintFuka example

Lecture d'une partie des physiques :

  • Painterly — davantage de détail peint
  • Soft — image plus douce
  • No_lineart — pas de trait (fonctionne comme un négatif)
  • 8k; 16k / High Quality — on demande une très haute qualité
  • Hdr — contraste plus marqué entre lumières et ombres
  • Blue lips — le personnage a les lèvres bleues
  • Fair_skin:2 — on y tient vraiment, à cette peau claire
  • Long Two-Toned Dark_blue Hair — cheveux longs en deux nuances de bleu
  • Realistic_character_anatomy — anatomie réaliste

Anatomie d'un prompt avancé

Il est temps d'utiliser toutes nos nouvelles connaissances pour être plus créatifs avec nos prompts ! Pour cela, nous utiliserons l'arrière-plan et les vêtements de PaintFuka.

Voici une comparaison entre des prompts non stylisés et stylisés :

Non styliséStylisé
Not stylizedStylized

Décrivons d'abord une image que nous voulons créer :

  • Nombre de personnes : 1
  • Perspective : plan américain (perspective genoux-haut)
  • Personnage portant une robe d'été blanche
  • Personnage court en tendant une main
  • Expression : Souriant
  • Arrière-plan : Pas important, peut être flou pour faire ressortir le personnage
  • Qualité : Illustration réaliste extrêmement détaillée

En tenant compte de cette liste, préparons tous les LoRAs, le scheduler et les mots-clés.

Parce que nous voulons que l'image ressemble à une illustration réaliste détaillée, utilisons des LoRAs juste pour ça !

Voici le résultat de l'application des LoRAs Micro / Fine details :6 et Realistic Illustration :6 :

Avec LoRAsSans LoRAs
With LoRAsWithout LoRAs

Maintenant, habillons-la et faisons-la courir !

Prompt final :

Paramètres avancés :

  • LoRA : Micro / Fine details :6, Realistic Illustration :6
  • Force du prompt : 11.0
  • CLIP Skip : 2
  • Scheduler : DPM++ 2M
  • Orientation de l'image : Paysage
  • Seed : Aléatoire
  • Prompt : Portrait
  • Arrière-plan : PaintFuka
  • Vêtements : PaintFuka
  • Prompt d'image : (solo, alone)+++, (macro_detail, clean_composition, color_balance, 8k_realistic_render, professional_product_shot)+++, (close, cowboy_shot)++++, (white_summer_dress---)2, (running)+++, (reaching_out, one_hand, outstretched_hand)+++, (smiling, Happy, open_mouth, closed_eyes)+, (blurry_background--)2

Résultat final :

Final result

Analysons maintenant ce qui est entré dans le prompt et comment ça fonctionne :

  • (solo, alone)+++ - fait apparaître le personnage seul dans l'image
  • (macro_detail, clean_composition, color_balance, 8k_realistic_render, professional_product_shot)+++ - ceux-ci indiquent à l'IA la qualité de l'image que nous voulons obtenir
  • (close, cowboy_shot)++++ - Cela indique à l'IA que nous voulons un plan américain vraiment serré
  • (white_summer_dress---)2 - Cela force l'IA à donner à notre personnage une robe d'été blanche
  • (running)+++ - Cela indique à l'IA que nous voulons que notre personnage court
  • (reaching_out, one_hand, outstretched_hand)+++ - Cela indique précisément à l'IA quel type de pose nous voulons
  • (smiling, Happy, open_mouth, closed_eyes)+ - Cela définit l'expression de notre personnage
  • (blurry_background--)2 - Cela force l'IA à nous donner un arrière-plan flou

En bonus, voici l'effet de l'ajout d'un seul LoRA supplémentaire :

Effect of adding one more LoRA

Problèmes courants

Le problème le plus courant est la dégradation de la qualité - certains utilisateurs appellent cela "carpetization" car les images cassées ressemblent à des gros plans de surface de tapis.

Cela est probablement dû à :

  • Trop de poids
  • Trop de force sur les LoRAs
  • Tags conflictuels

Édition d'image par IA

Modifier une image existante est un outil distinct de la génération, et c'est le seul endroit de la plateforme où l'on s'adresse au modèle en phrases normales, quel que soit le modèle qui a produit l'image.

Où le trouver

  1. Ouvrez la galerie d'un kyn
  2. Choisissez l'image à modifier
  3. Appuyez sur EDIT IMAGE
Interface d'édition d'image

Comment écrire l'instruction

Des phrases descriptives, pas des tags. Dites ce qui doit changer : « Change les cheveux du personnage en blanc et rends sa peau plus foncée. » Vous disposez de 2 500 caractères d'instruction et d'un réglage Nombre de variations si vous voulez plusieurs essais d'un coup.

Exemple de résultat d'édition

Préréglages de style

En plus de l'édition simple, treize améliorations de style : None (Standard Edit), Caricature, Next Scene, Photo to Anime, Balloon Inflate, Object Remover, Object Adder, Polaroid Photo, Camera Angle Change, Futanarify, To Realistic Photo, Upscale Quality et 18+ Mode.

Deux choses à savoir avant de commencer

  • Les résultats sont mis en attente de validation. Les éditions générées expirent au bout de 30 minutes si vous ne les confirmez pas — marquez celles à supprimer, ou choisissez celle que vous gardez, puis confirmez.
  • Le modèle d'édition n'est pas entraîné sur du contenu adulte. L'application le dit elle-même : vous pouvez essayer, mais cela échouera très probablement. La génération est non censurée ; l'édition n'est pas le même outil et ne porte pas la même promesse.

L'édition d'image nécessite Premium.

Continuer l'exploration

Les pages lues juste après.