LEISTUNGENCASE STUDIESPRODUKTEBLOGÜBER UNS15 MIN ANALYSE
← RESSOURCEN
Das 7-Schritt-Avatar-Protokoll
5 Seiten · PDF · KOSTENLOS

Automatisierung

Das 7-Schritt-Avatar-Protokoll

Eine Arbeitsanweisung, kein Ratgeber. Einmal ausfüllen, danach in jedes Bild kopieren.

Von Robby Schadt · Thema Automatisierung mit KI-Agenten · Zuletzt aktualisiert am

DIREKT ZUM KOSTENLOSEN PDF ↓

Das 7-Schritt-Avatar-Protokoll ist eine Arbeitsanweisung, die festlegt, was an deiner KI-Figur über alle Bilder hinweg gleich bleiben muss: Stimme, Rahmen, fünf feste Merkmale, drei Posen und eine Stichprobe vor der Veröffentlichung. Drei Schritte richtest du einmal ein, drei gehören in jeden einzelnen Auftrag, einer sichert die Veröffentlichung ab. Gedacht für alle, die mit KI-Bildern regelmäßig posten und deren Figur ab Karte drei aussieht wie eine andere Person. Stand: August 2026.

Warum sieht mein KI-Avatar in jedem Bild anders aus?

Weil jedes Bild bei null anfängt. Ein Text-zu-Bild-Generator erzeugt aus einer Textbeschreibung ein neues Bild und erinnert sich dabei nicht an das, was du zehn Minuten vorher erzeugt hast. Er liest deinen Auftrag, füllt alles Ungesagte mit Durchschnitt und würfelt genau die Details neu, die du nicht festgeschrieben hast. Szene 1 sitzt, Szene 2 ist fast richtig, ab Szene 3 sitzt eine fremde Person auf deinem Karussell.

Das ist keine Randbeobachtung, sondern die Bauart. t3n formuliert es in einem Test der Midjourney-Charakterreferenz so: "Konsistenz bleibt allerdings ein Problem, denn jeder Prompt erzeugt ein ganz neues Bild. Selbst wenn ihr denselben Prompt wiederholt, erhaltet ihr immer neue Ergebnisse" (t3n, 2024). Die Anbieter sagen dasselbe, nur freundlicher: Googles Dokumentation zur Bildgenerierung rät bei wiederkehrenden Figuren ausdrücklich, bereits erzeugte Bilder in jeden weiteren Auftrag mit hineinzugeben, damit die Ähnlichkeit hält (Gemini API, Google, 2026).

Das Problem liegt also nicht im Werkzeug, sondern in dem, was du vor dem ersten Bild versäumt hast. Wer das genauer nachlesen will: im Beitrag KI-Klon: So bleibt dein Avatar immer dieselbe Person steht die Mechanik dahinter, und KI-Bilder verbessern erklärt, warum ein Modell beim Nachbessern gleich das ganze Bild umbaut.

Was lege ich einmal fest und was gehört in jedes Bild?

Das ist die Trennung, an der die meisten scheitern. Sie behandeln alles als Einmal-Aufgabe und wundern sich, dass der Anfangserfolg nicht hält.

Gezählt werden sieben Schritte: drei richtest du einmal pro Person ein (Teil A), drei gehören in jeden einzelnen Bildauftrag (Teil B), einer steht vor der Veröffentlichung (Teil C).

SchrittWannWas du festlegst
1einmal pro PersonReferenz-Datei aus deinen abgetippten eigenen Aufnahmen, damit die Maschine nach dir klingt und nicht nach Durchschnitt
2einmal pro PersonRahmen-Datei: Zielgruppe, deine Wörter, deine Tabus, deine belegbaren Beweise
3einmal pro Persondeine eigene geklonte Stimme statt einer Standard-Stimme, die dein Publikum nach zwei Videos wiedererkennt
4in jedes Bildein fester Merkmal-Block, den du unverändert kopierst
5in jedes BildBild und Schrift in zwei getrennten Durchgängen
6in jedes BildBegrenzung auf drei Posen, statt jede Karte neu zu erfinden
7vor jeder VeröffentlichungStichprobe aus zwei zufällig gezogenen Karten

Die Schritte 1 bis 3 kosten dich einen Abend und gelten danach für jedes weitere Bild. Die Schritte 4 bis 6 kosten pro Karte Minuten. Wer sie streicht, weil das erste Bild ja gesessen hat, ist genau der Fall aus dem Absatz oben.

Welche Merkmale halten ein Gesicht wirklich fest?

Fünf Kategorien reichen, wenn du sie richtig aufschreibst: Gesicht, Haare, Kleidung, Umgebung, Licht. Entscheidend ist die Formulierungsrichtung. Du schreibst hin, was da sein muss, nicht was verboten ist. Ein Verbot hält kein Merkmal fest, es entfernt nur eine von tausend Alternativen.

Drei dieser fünf Kategorien nimmt dir ein gutes Werkzeug teilweise ab. Midjourneys Charakterreferenz zieht beim Standardwert --cw 100 Gesicht, Haare und Kleidung aus deinem Vorlagenbild, bei Wert 0 nur noch das Gesicht (t3n, 2024). Umgebung und Licht bleiben in jedem Fall deine Aufgabe, und genau dort bricht die Serie meistens zuerst.

Zweite Regel: konkret statt stimmungsvoll. "Casual" ist keine Kleidung und "gemütlich" ist keine Umgebung. Beides überlässt dem Modell die Entscheidung, und das Modell entscheidet bei jedem Auftrag neu. Googles Anbieter-Doku nennt dieselbe Regel unter "Be hyper-specific" und zeigt sie am Beispiel: nicht "fantasy armor" schreiben, sondern die Rüstung mit Material, Muster und Kragenform ausbuchstabieren (Gemini API, Google, 2026). Halte dabei die Besetzung klein: dasselbe Dokument beziffert die verlässliche Ähnlichkeit auf bis zu 4 Personen und die Objekttreue auf bis zu 10 Objekte in einem Durchgang. Wenn du deine Anker sauber vorformuliert brauchst, liegt daneben das Anker-Blatt für konsistente Avatar-Szenen.

Warum brechen Schrift und Umlaute in KI-Bildern?

Weil du zwei Aufgaben in einen Auftrag packst. Verlangst du Person und Text gleichzeitig, bekommst du beides halb: Das Gesicht driftet, weil Rechenaufmerksamkeit in die Buchstaben geht, und die Buchstaben brechen, weil das Modell Schrift malt statt setzt. Deutsche Umlaute und das ß trifft es zuerst.

Die Trennung in zwei Durchgänge ist kein Geschmacksurteil, sie steht so in der Anbieter-Doku. Google empfiehlt für Bilder mit Text ausdrücklich, zuerst den Text zu erzeugen und erst danach das Bild mit diesem Text anzufordern (Gemini API, Google, 2026). Das kostet dich zwei Minuten pro Karte und nimmt die häufigste Fehlerquelle komplett raus. Für die Stimme dahinter gilt dasselbe Prinzip in Textform, nachzulesen in Dein KI-Content klingt nach ChatGPT, nicht nach dir.

Wie prüfe ich vor der Veröffentlichung, ob der Avatar hält?

Nicht mit dem Gefühl, sondern mit einer Stichprobe. Zwei Karten zufällig ziehen, ausdrücklich nicht die Lieblingskarten, und gegen das Cover halten. Geprüft werden Gesicht, Hände, Schrift und Umlaute, jeweils im direkten Bildvergleich statt aus dem Gedächtnis.

Und die Konsequenz gehört dazu: Fällt ein Punkt durch, geht die Karte zurück in Durchgang 1. Nicht nachbessern, neu bauen. Nachbessern erzeugt im gerenderten Bild fast immer den nächsten Bruch. Wer die typischen Bruchstellen einzeln durchgehen will, findet sie im Avatar-Bruch-Check.

Was steckt im PDF?

Das PDF ist die Arbeitsfassung zum Abarbeiten: alle sieben Schritte mit den konkreten Formulierungen, die Merkmal-Tabelle mit der Spalte "So schreibst du es auf", pro Schritt ein "Fertig, wenn"-Kriterium zum Abhaken und die Kurzfassung als Sieben-Punkte-Liste für den zweiten Avatar. Fünf Seiten, gebrandet, zum Ausdrucken oder Danebenlegen. Trag unten deine E-Mail ein, dann liegt es sofort im Postfach.

Kostenlos herunterladen

Alle sieben Schritte als Arbeitsfassung zum Abarbeiten, mit den konkreten Formulierungen statt nur dem Prinzip. Enthalten sind die Merkmal-Tabelle mit der Spalte "So schreibst du es auf", pro Schritt ein "Fertig, wenn"-Kriterium zum Abhaken und die Kurzfassung als Sieben-Punkte-Liste für den zweiten Avatar. Fünf Seiten, gebrandet, zum Ausdrucken oder Danebenlegen.

Name + E-Mail, kein Spam, kein Abo. Du erhältst das PDF direkt per E-Mail.

Mit dem Absenden stimmst du zu, gelegentlich relevante Inhalte von adcompany zu erhalten. Abmeldung jederzeit. Datenschutz

Häufige Fragen

Warum sieht mein KI-Avatar in jedem Bild anders aus?

Weil jedes Bild bei null anfängt. Das Modell erinnert sich nicht an vorherige Bilder, es liest nur den aktuellen Auftrag und füllt alles Ungesagte mit Durchschnitt. Alles, was du nicht ausdrücklich festschreibst, wird bei jedem Auftrag neu gewürfelt.

Wie halte ich ein KI-Gesicht über mehrere Bilder konsistent?

Mit einem festen Merkmal-Block, den du unverändert in jeden Auftrag kopierst. Fünf Kategorien reichen: Gesicht, Haare, Kleidung, Umgebung, Licht. Entscheidend ist, dass du hinschreibst, was da sein muss, statt was verboten ist. Verbote halten kein Merkmal fest.

Warum schreibt die KI Umlaute und Text im Bild falsch?

Weil Bild und Schrift in einem Durchgang verlangt werden. Dann bekommst du beides halb: das Gesicht driftet und die Buchstaben brechen, bei ä, ö, ü und ß zuerst. Bau das Bild in Durchgang 1 ohne Textvorgabe und setz die Schrift in Durchgang 2 als eigene Ebene darüber.

Wie viele Posen sollte ein KI-Avatar haben?

Drei: Anchor für Cover und Abschluss, Story für die Argument-Karten, Twist für den Wendepunkt oder das ruhige Ende. Jede weitere Pose ist eine zusätzliche Gelegenheit für einen Bruch. Ausnahme: Du zeigst Konsistenz absichtlich als Thema, dann darf der Wechsel sichtbar sein.

Reicht eine Standard-Stimme für KI-Videos oder brauche ich einen Stimmklon?

Standard-Stimmen erkennt dein Publikum nach zwei Videos. Für einen eigenen Klon reichen 3 bis 5 Minuten sauberes Audio aus einem ruhigen Raum, gleiches Mikro, gleicher Abstand, normal gesprochen statt abgelesen. Die Stimm-ID legst du zu deinen anderen Referenz-Dateien.

Passend dazu

NO-CODE Mastery (997 € netto): KI-Agenten und Automationen ohne ProgrammierungKI-Klon: So bleibt dein Avatar immer dieselbe PersonKI-Bilder verbessern: Warum ChatGPT dein ganzes Bild ändertDein KI-Content klingt nach ChatGPT, nicht nach dirDer Agenten-Rollen-BauplanDie Credit-BremseDie Parallel-Umbau-Checkliste