Das 7-Schritt-Avatar-Protokoll ist eine Arbeitsanweisung, die festlegt, was an deiner KI-Figur über alle Bilder hinweg gleich bleiben muss: Stimme, Rahmen, fünf feste Merkmale, drei Posen und eine Stichprobe vor der Veröffentlichung. Drei Schritte richtest du einmal ein, drei gehören in jeden einzelnen Auftrag, einer sichert die Veröffentlichung ab. Gedacht für alle, die mit KI-Bildern regelmäßig posten und deren Figur ab Karte drei aussieht wie eine andere Person. Stand: August 2026.
Warum sieht mein KI-Avatar in jedem Bild anders aus?
Weil jedes Bild bei null anfängt. Ein Text-zu-Bild-Generator erzeugt aus einer Textbeschreibung ein neues Bild und erinnert sich dabei nicht an das, was du zehn Minuten vorher erzeugt hast. Er liest deinen Auftrag, füllt alles Ungesagte mit Durchschnitt und würfelt genau die Details neu, die du nicht festgeschrieben hast. Szene 1 sitzt, Szene 2 ist fast richtig, ab Szene 3 sitzt eine fremde Person auf deinem Karussell.
Das ist keine Randbeobachtung, sondern die Bauart. t3n formuliert es in einem Test der Midjourney-Charakterreferenz so: "Konsistenz bleibt allerdings ein Problem, denn jeder Prompt erzeugt ein ganz neues Bild. Selbst wenn ihr denselben Prompt wiederholt, erhaltet ihr immer neue Ergebnisse" (t3n, 2024). Die Anbieter sagen dasselbe, nur freundlicher: Googles Dokumentation zur Bildgenerierung rät bei wiederkehrenden Figuren ausdrücklich, bereits erzeugte Bilder in jeden weiteren Auftrag mit hineinzugeben, damit die Ähnlichkeit hält (Gemini API, Google, 2026).
Das Problem liegt also nicht im Werkzeug, sondern in dem, was du vor dem ersten Bild versäumt hast. Wer das genauer nachlesen will: im Beitrag KI-Klon: So bleibt dein Avatar immer dieselbe Person steht die Mechanik dahinter, und KI-Bilder verbessern erklärt, warum ein Modell beim Nachbessern gleich das ganze Bild umbaut.
Was lege ich einmal fest und was gehört in jedes Bild?
Das ist die Trennung, an der die meisten scheitern. Sie behandeln alles als Einmal-Aufgabe und wundern sich, dass der Anfangserfolg nicht hält.
Gezählt werden sieben Schritte: drei richtest du einmal pro Person ein (Teil A), drei gehören in jeden einzelnen Bildauftrag (Teil B), einer steht vor der Veröffentlichung (Teil C).
| Schritt | Wann | Was du festlegst |
|---|---|---|
| 1 | einmal pro Person | Referenz-Datei aus deinen abgetippten eigenen Aufnahmen, damit die Maschine nach dir klingt und nicht nach Durchschnitt |
| 2 | einmal pro Person | Rahmen-Datei: Zielgruppe, deine Wörter, deine Tabus, deine belegbaren Beweise |
| 3 | einmal pro Person | deine eigene geklonte Stimme statt einer Standard-Stimme, die dein Publikum nach zwei Videos wiedererkennt |
| 4 | in jedes Bild | ein fester Merkmal-Block, den du unverändert kopierst |
| 5 | in jedes Bild | Bild und Schrift in zwei getrennten Durchgängen |
| 6 | in jedes Bild | Begrenzung auf drei Posen, statt jede Karte neu zu erfinden |
| 7 | vor jeder Veröffentlichung | Stichprobe aus zwei zufällig gezogenen Karten |
Die Schritte 1 bis 3 kosten dich einen Abend und gelten danach für jedes weitere Bild. Die Schritte 4 bis 6 kosten pro Karte Minuten. Wer sie streicht, weil das erste Bild ja gesessen hat, ist genau der Fall aus dem Absatz oben.
Welche Merkmale halten ein Gesicht wirklich fest?
Fünf Kategorien reichen, wenn du sie richtig aufschreibst: Gesicht, Haare, Kleidung, Umgebung, Licht. Entscheidend ist die Formulierungsrichtung. Du schreibst hin, was da sein muss, nicht was verboten ist. Ein Verbot hält kein Merkmal fest, es entfernt nur eine von tausend Alternativen.
Drei dieser fünf Kategorien nimmt dir ein gutes Werkzeug teilweise ab. Midjourneys Charakterreferenz zieht beim Standardwert --cw 100 Gesicht, Haare und Kleidung aus deinem Vorlagenbild, bei Wert 0 nur noch das Gesicht (t3n, 2024). Umgebung und Licht bleiben in jedem Fall deine Aufgabe, und genau dort bricht die Serie meistens zuerst.
Zweite Regel: konkret statt stimmungsvoll. "Casual" ist keine Kleidung und "gemütlich" ist keine Umgebung. Beides überlässt dem Modell die Entscheidung, und das Modell entscheidet bei jedem Auftrag neu. Googles Anbieter-Doku nennt dieselbe Regel unter "Be hyper-specific" und zeigt sie am Beispiel: nicht "fantasy armor" schreiben, sondern die Rüstung mit Material, Muster und Kragenform ausbuchstabieren (Gemini API, Google, 2026). Halte dabei die Besetzung klein: dasselbe Dokument beziffert die verlässliche Ähnlichkeit auf bis zu 4 Personen und die Objekttreue auf bis zu 10 Objekte in einem Durchgang. Wenn du deine Anker sauber vorformuliert brauchst, liegt daneben das Anker-Blatt für konsistente Avatar-Szenen.
Warum brechen Schrift und Umlaute in KI-Bildern?
Weil du zwei Aufgaben in einen Auftrag packst. Verlangst du Person und Text gleichzeitig, bekommst du beides halb: Das Gesicht driftet, weil Rechenaufmerksamkeit in die Buchstaben geht, und die Buchstaben brechen, weil das Modell Schrift malt statt setzt. Deutsche Umlaute und das ß trifft es zuerst.
Die Trennung in zwei Durchgänge ist kein Geschmacksurteil, sie steht so in der Anbieter-Doku. Google empfiehlt für Bilder mit Text ausdrücklich, zuerst den Text zu erzeugen und erst danach das Bild mit diesem Text anzufordern (Gemini API, Google, 2026). Das kostet dich zwei Minuten pro Karte und nimmt die häufigste Fehlerquelle komplett raus. Für die Stimme dahinter gilt dasselbe Prinzip in Textform, nachzulesen in Dein KI-Content klingt nach ChatGPT, nicht nach dir.
Wie prüfe ich vor der Veröffentlichung, ob der Avatar hält?
Nicht mit dem Gefühl, sondern mit einer Stichprobe. Zwei Karten zufällig ziehen, ausdrücklich nicht die Lieblingskarten, und gegen das Cover halten. Geprüft werden Gesicht, Hände, Schrift und Umlaute, jeweils im direkten Bildvergleich statt aus dem Gedächtnis.
Und die Konsequenz gehört dazu: Fällt ein Punkt durch, geht die Karte zurück in Durchgang 1. Nicht nachbessern, neu bauen. Nachbessern erzeugt im gerenderten Bild fast immer den nächsten Bruch. Wer die typischen Bruchstellen einzeln durchgehen will, findet sie im Avatar-Bruch-Check.
Was steckt im PDF?
Das PDF ist die Arbeitsfassung zum Abarbeiten: alle sieben Schritte mit den konkreten Formulierungen, die Merkmal-Tabelle mit der Spalte "So schreibst du es auf", pro Schritt ein "Fertig, wenn"-Kriterium zum Abhaken und die Kurzfassung als Sieben-Punkte-Liste für den zweiten Avatar. Fünf Seiten, gebrandet, zum Ausdrucken oder Danebenlegen. Trag unten deine E-Mail ein, dann liegt es sofort im Postfach.