Warum KI-Menschen immer noch fake wirken
Es ist meist Überperfektion, nicht Unterqualität
Der Instinkt ist anzunehmen, ein fake wirkender KI-Mensch braucht mehr Auflösung oder ein besseres Modell. Oft ist das Gegenteil wahr: perfekte Haut, perfekte Symmetrie und perfekt gleichmäßige Beleuchtung sind es, die die Uncanny-Valley-Reaktion auslösen, weil die Realität unvollkommen ist und das Auge eines Betrachters darauf trainiert ist, diese Abwesenheit zu bemerken, auch ohne sie bewusst zu benennen.
Interessanterweise übersetzen sich höhere Realismus-Werte nicht automatisch in komfortablere Betrachterreaktionen; ein technisch fotorealistischeres Bild kann sich trotzdem "falsch" anfühlen, wenn ihm die spezifischen Unvollkommenheiten fehlen, die ein echtes Foto hat. Die Lösung ist nicht mehr Politur, sondern das gezielte Zurückbringen des Mikrodetails, das Modelle standardmäßig glätten.
Die schwierigsten Merkmale: Augen und Hände
Immer noch die zwei hartnäckigsten Fehlermodi
Augen sind, wo Betrachter zuerst hinschauen, und subtile Probleme (nicht übereinstimmende Lichtreflexe, unnatürliches Irisdetail, ein zu gleichmäßiger Blick) sind, was das sofortige Unbehagen auslöst, das klassische Uncanny-Valley-Reaktionen beschreiben. Hände bleiben ein separates und berüchtigt hartnäckiges Problem: fehlgeformte KI-Hände waren noch Mitte 2026 ein weit verbreiteter Fehler, lange nachdem die meisten anderen Qualitätsprobleme von neueren Modellen weitgehend gelöst worden waren.
Bei Augen hilft es mehr als eine generische "realistische Augen"-Anweisung, explizit nach einer natürlichen Lichtreflex-Position passend zur Lichtquelle der Szene und leichter Asymmetrie zwischen den beiden Augen zu fragen. Bei Händen ist der zuverlässigste Fix in der Praxis immer noch, unbeholfene Handposen in der Komposition zu vermeiden (Hände an den Seiten, teilweise außerhalb des Bildausschnitts oder ein Objekt haltend), statt zu erwarten, dass eine voll geöffnete, detaillierte Hand jedes Mal korrekt gerendert wird.
Haut und Mikrodetail
Die Schicht, die die Illusion verkauft
Die letzte Realismus-Schicht kommt aus den Mikrodetails, die ein Modell standardmäßig glättet: sichtbare Poren, feine Linien, ein paar einzelne Haare, subtile Ungleichmäßigkeit im Hautton. Das ist, was ein "technisch hochauflösendes" Bild von einem unterscheidet, das tatsächlich wie ein echtes Foto wirkt.
Detaillierte Hautstruktur, sichtbare Poren und leichte Unvollkommenheiten anzufragen, plus einzelne sichtbare Haarsträhnen und ein paar Fliegenhaare statt gleichmäßig glattem Haar, schließt den Großteil der verbleibenden Lücke. Das ist eher ein Textur- als ein Auflösungsproblem; ein detailarmes Bild mit korrekter Mikrotextur wirkt oft realer als ein hochauflösendes Bild ohne sie.
Beleuchtungskonsistenz
Gleichmäßiges Licht ist ein Erkennungsmerkmal für synthetische Fotos
Echte Fotografie hat gerichtetes, leicht ungleichmäßiges Licht: eine sichtbare Lichtquelle, weichen Schattenverlauf und einen Lichtreflex in den Augen, der zu dem passt, woher das Licht tatsächlich kommt. Gleichmäßig verteiltes Licht über ein ganzes Gesicht und eine Szene ist eine häufige Signatur synthetischer Bilder, weil es für ein Modell leicht als Standard zu nehmen und für einen Betrachter schwer bewusst als falsch zu markieren ist, obwohl es als "seltsam" registriert wird.
Eine Lichtquelle, ihre Richtung und ihre Qualität zu spezifizieren (zum Beispiel weiches Fensterlicht von einer Seite, mit sichtbarem Schatten auf der anderen) gibt dem Modell ein konkretes Beleuchtungsszenario zum Simulieren statt der flachen, ambienten Standardeinstellung.
Nachbearbeitung: LoRA, Upscaling und Skin-Detailer
Der Finishing-Durchgang, kein Ersatz für eine gute Basisgenerierung
- Upscaling. Ein dedizierter Upscaler gewinnt feines Detail zurück, das eine Basisgenerierung komprimiert weglässt, was am meisten für Hautstruktur und Haarsträhnen spezifisch zählt.
- Skin-Detailer-Durchgänge. Ein gezielter Verfeinerungsdurchgang nur auf Gesicht und Hautbereich fügt Poren-Level-Textur hinzu, ohne das ganze Bild neu zu rendern, und behebt die häufigste verbleibende Flachheit.
- LoRA-Feintunings. Eine auf echter Fotografie (statt illustrierter oder stilisierter Daten) trainierte LoRA verschiebt die Standardausgabe des Basismodells hin zu fotografischer Textur und Beleuchtungsverhalten, noch bevor überhaupt gepromptet wird.
- Gezieltes Schärfen. Leichtes, gezieltes Schärfen von Augen und Hautdetail, angewendet nach dem Upscaling, vermeidet den übermäßig geschärften, künstlichen Look, den globales Schärfen produziert.
Realismus einmal vs. Realismus jedes Mal
Ein einzelnes realistisches Bild löst keinen wiederkehrenden Charakter
Jede Technik oben funktioniert für ein Bild. Die schwierigere Version des Problems, dieselbe Person über Dutzende zukünftige Fotos hinweg realistisch und identisch aussehen zu lassen, ist ein Konsistenzproblem, das auf ein Realismusproblem geschichtet ist, und Prompts, Negative Prompts und Nachbearbeitung separat für jede neue Generierung von Hand abzustimmen, skaliert nicht.
Bei RYLA bettet das Erstellen eines KI-Influencers die Realismus-Arbeit einmal in den Charakter ein, sodass Textur, Beleuchtungsverhalten und Identität automatisch weitergetragen werden. Siehe wie man bessere Prompts für realistische KI-Charaktere schreibt für die Prompting-Seite dieses Problems, und wie man einen KI-Influencer konsistent hält für eine vollständige Übersicht der Konsistenz-Techniken (Seeds, LoRA, Identitäts-Adapter, Face-Swap), die ein realistisches Gesicht über Generierungen hinweg identisch halten.
