Die Prompt-Struktur, die tatsächlich funktioniert
Reihenfolge zählt genauso viel wie die Wortwahl
Ein Prompt, der zuverlässig eine realistische KI-Person erzeugt, folgt tendenziell einer konsistenten Reihenfolge: zuerst die Motivbeschreibung, dann Fotostil oder Kamerareferenz, dann Objektivspezifikation, dann Beleuchtungsaufbau, dann Umgebungsdetails und technische Qualitätsbegriffe zuletzt. Das Motiv vorne zu platzieren und technisches Detail am Ende ausklingen zu lassen passt dazu, wie ein Modell frühe Tokens stärker gewichtet, sodass der wichtigste Inhalt (wer die Person ist und wie sie aussieht) nie unter einer Wand von Kamera-Fachbegriffen begraben werden sollte.
Ein schwacher Prompt listet Adjektive ohne Struktur auf: "schöne Frau, fotorealistisch, 8k, detailliert." Ein strukturierter Prompt liest sich wie die Aufnahmebeschreibung eines Fotografen: wer das Motiv ist, welche Kamera und welches Objektiv die Aufnahme simulieren, woher das Licht kommt, wie die Umgebung aussieht, und erst dann die technischen Qualitätsmarker.
Kamera- und Objektiv-Sprache
Echte Optik simulieren, statt nach "realistisch" zu fragen
Echte Kamera- und Objektivdetails hinzuzufügen, zum Beispiel "aufgenommen mit einer Canon EOS R5, 85mm f/1.8 Objektiv, ISO 200," bringt das Modell dazu, die optischen Eigenschaften eines tatsächlichen Fotos zu simulieren statt eines generischen Renderings. Jede Kamera- und Objektivkombination bringt eigene Merkmale mit: Tiefenschärfe, Bokeh-Form und subtile Tonnenverzeichnung, alles Dinge, die ein echtes Foto hat und ein flaches KI-Render meist nicht.
Ein Porträtobjektiv wie ein 85mm bei weiter Blende erzeugt den weichen, unscharfen Hintergrund und die geringe Schärfentiefe, die sofort als "professionelles Foto" statt "Illustration" gelesen wird. Ein konkretes Objektiv zu nennen ist effektiver als nur das Wort "professionell," weil das Modell konkretes optisches Verhalten zum Imitieren hat statt eines abstrakten Adjektivs zum Interpretieren.
Hautstruktur richtig hinbekommen
Drei Elemente, nicht ein Adjektiv
Realistische Haut braucht drei separate Prompt-Elemente, die zusammenwirken, nicht ein einzelnes Wort wie "realistische Haut." Erstens Texturbeschreibungen: "natürliche Hautstruktur mit sichtbaren Poren und feinen Linien." Zweitens Beleuchtungssprache, die speziell Subsurface Scattering hervorruft, das subtile durchscheinende Glühen, das echte Haut unter Licht hat, was eine flache "gute Beleuchtung"-Anweisung nicht erfasst. Drittens ein Negative Prompt, der die Fehlermodi explizit ausschließt: plastische Haut, wachsartige Textur und wegretuschierte Glätte.
Begriffe wie "natürliche Hautstruktur," "sichtbare Poren" oder "leichte Sommersprossen" leisten mehr Arbeit als "fotorealistische Haut" allein, weil sie dem Modell konkretes Mikrodetail zum Rendern geben, statt eines vagen Qualitätsziels, das es durch Glätten von allem erfüllen kann, was das Gegenteil dessen ist, was Realismus tatsächlich braucht.
Was mit Negative Prompts ausgeschlossen werden sollte
Realismus hängt genauso vom Ausschließen wie vom Einfordern ab
- Plastische, wachsartige oder wegretuschierte Haut. Der häufigste Fehlermodus; ihn explizit auszuschließen ist zuverlässiger, als auf positive Hautstruktur-Begriffe allein zu hoffen.
- Perfekte Symmetrie. Echte Gesichter sind subtil asymmetrisch. Ein Prompt, der das nie erwähnt, tendiert zu einem unnatürlich gleichmäßigen, symmetrischen Gesicht, das synthetisch wirkt.
- Übermäßig geglättete oder übermäßig geschärfte Ausgabe. Beide Extreme wirken künstlich; das Ziel ist die Mitte, die ein echter Kamerasensor produziert, nicht ein Beauty-Filter-Finish.
- Generische KI-Artefakte. Übermäßige Rauschunterdrückung, unnatürlich gleichmäßige Beleuchtung und flache Hintergründe drängen ein Ergebnis alle zurück in Richtung computergeneriert.
Häufige Fehler, die Gesichter fake wirken lassen
Überperfektion ist das mit Abstand größte Erkennungsmerkmal
Perfekte Haut, perfektes Haar und perfekt symmetrische Gesichtszüge wirken fake genau deshalb, weil die Realität unvollkommen ist, und das Auge eines Betrachters ist darauf trainiert, diese Abwesenheit zu bemerken, auch ohne bewusst zu benennen warum. Die Lösung ist, kleine, gezielte Unvollkommenheiten zu prompten statt mehr Perfektion: einzelne sichtbare Haarsträhnen und ein paar Fliegenhaare statt gleichmäßig glattem Haar, subtile Textur unter den Augen statt makelloser Haut, ein leicht asymmetrischer Ausdruck statt eines perfekt zentrierten.
Der andere häufige Fehler ist, generische Qualitätswörter zu stapeln ("hyperrealistisch, 8k, ultra detailliert, Meisterwerk") ohne eine der strukturellen oder Texturbegriffe von oben. Diese Begriffe allein sagen dem Modell fast nichts Konkretes zum Rendern; eine bestimmte Kamera, ein bestimmter Beleuchtungsaufbau und bestimmtes Texturdetail leisten weit mehr der tatsächlichen Arbeit.
Einmal prompten vs. jedes Mal prompten
Ein realistisches Einzelbild ist ein anderes Problem als ein realistischer Charakter
Alles oben löst Realismus für ein Bild. Realismus über Dutzende Bilder derselben Person hinweg, mit demselben Gesicht, das Aufnahme für Aufnahme hält, ist ein schwierigeres Problem, das handgeschriebene Prompts allein nicht lösen; ein leicht anderer Prompt an Tag zwei tendiert dazu, das Gesicht driften zu lassen, selbst wenn der Wortlaut fast identisch aussieht.
Bei RYLA fixiert das Erstellen eines KI-Influencers die Realismus-Arbeit (Hautstruktur, Beleuchtungsverhalten, Identität) einmal, sodass jede zukünftige Generierung sie automatisch erbt, statt dass der Prompt Fotorealismus jedes Mal von Grund auf neu verdienen muss. Siehe wie man KI-generierte Menschen realistischer aussehen lässt für die breitere Palette an Realismus-Techniken jenseits des Promptens, und wie man einen KI-Influencer konsistent hält für die Identitätsseite desselben Problems.
