LEISTUNGENCASE STUDIESPRODUKTEBLOGÜBER UNS15 MIN ANALYSE
← RESSOURCEN
Von Chaos zu sauberem Asset-Archiv: Video-Organisation nach dem Videotag
8 Seiten · PDF · KOSTENLOS

Produktion

Von Chaos zu sauberem Asset-Archiv: Video-Organisation nach dem Videotag

dji_mimo_20260410_165314_1775837351144_video.mp4. Was war das nochmal? Dieses Script-Kit baut dir in unter einer Stunde ein durchsuchbares Ad-Asset-Archiv. Mit KI-Transkription, lokal, ohne Cloud.

Von Robby Schadt · Thema KI-Content und Avatare · Zuletzt aktualisiert am

DIREKT ZUM KOSTENLOSEN PDF ↓

Video-Organisation nach dem Videotag bedeutet: rohes Kamera-Footage in unter einer Stunde in ein sauber beschriftetes, durchsuchbares Ad-Asset-Archiv verwandeln. Der Weg dahin: lokale KI-Transkription mit mlx-whisper auf dem Mac, ein klares Namensschema pro Datei und eine Obsidian-Note mit allen Inhalten. Ohne Agentur, ohne Cloud, ohne Chaos.

Du kennst den Moment. Der Videotag ist vorbei, die Kamera hat geliefert, Dutzende Dateien liegen auf der Festplatte. Und dann so ein Name: dji_mimo_20260410_165314_1775837351144_video.mp4. Welcher Hook war das? Take 2? Welches Produkt? Keine Ahnung. Dieser Guide zeigt dir das System, mit dem jede Datei dir auf einen Blick sagt: Thema, Hook-Nummer, Take, Kamerawinkel.

Was ist das Ziel der Video-Organisation?

Am Ende hast du zwei Dinge. Erstens einen Videos-Ordner, in dem jede Datei selbsterklärend heißt, zum Beispiel hook_01_struktur_take_1.mp4, hook_07_dubai_take_1.mp4 oder legal_01_cta.mp4. Zweitens eine Video-Transkripte.md, in der alle gesprochenen Inhalte lesbar und durchsuchbar liegen. Das ist die ganze Hexerei: Aus namenlosem Footage wird ein Archiv, das du selbst, dein Editor und spätere KI-Tools verstehen.

Welche Voraussetzungen brauchst du?

Du brauchst einen Mac mit Apple Silicon (M1, M2, M3 oder M4). Die Einrichtung ist einmalig und dauert rund 10 Minuten. Drei Bausteine gehören dazu:

  1. 1.Homebrew als Paketmanager, falls noch nicht vorhanden.
  2. 2.ffmpeg und Python über Homebrew installiert. ffmpeg extrahiert das Audio aus den Videos.
  3. 3.mlx-whisper über pip installiert. Das ist der lokale Transkriptions-Motor.

Der Apple-Silicon-Bezug ist kein Zufall. mlx-whisper setzt auf MLX auf, laut Apples MLX-Repository ein Array-Framework für Machine Learning auf Apple Silicon aus Apples Machine-Learning-Forschung. Es rechnet auf CPU und GPU im gemeinsamen Speicher, ohne die Daten dazwischen zu kopieren. Dasselbe Repository nennt in der Installations-Sektion daneben ein CUDA- und ein CPU-Paket für Linux, MLX ist also nicht auf Apple-Hardware beschränkt. Dieser Guide beschreibt trotzdem nur den Weg über Apple Silicon, weil er nur dort getestet ist.

Warum lokal? mlx-whisper läuft direkt auf deinem Mac. Keine Cloud, keine API-Kosten, kein Datenschutzproblem. Einmal installiert, läuft das für immer. Kein Bastel-Sonderweg: Zu FFmpeg 8.0 hält heise online fest, dass der neue Whisper-Filter lokal arbeitet und keine Inhalte in die Cloud überträgt (13.08.2025, dort auch: Whisper transkribiert in über 90 Sprachen). Und wo Menschen sprechen, entstehen personenbezogene Daten. Der Landesbeauftragte für den Datenschutz Baden-Württemberg nennt bei KI-Transkription On-Premise oder eine abgeschottete Instanz als bevorzugte Systemarchitektur (Leitfaden Version 1.0, Stand 10.06.2026). Dieser Leitfaden richtet sich an öffentliche Stellen und Gemeinderatssitzungen, nicht an dein Ad-Footage. Die Richtung stimmt trotzdem.

Wie transkribierst du das Footage automatisch?

Das ist der Teil, bei dem du Kaffee holst und die Maschine arbeitet. Der Ablauf in Schritten:

  1. 1.Ordner anlegen und alle .mp4-Dateien der Kamera reinkopieren, zum Beispiel nach /Videos/Kunde-RAW. Noch nichts umbenennen, das kommt später in einem Rutsch.
  2. 2.Transkriptions-Script starten. Es zieht mit ffmpeg das Audio aus jedem Video (Mono, 16 kHz) und schickt es durch mlx-whisper mit dem Modell whisper-large-v3-turbo, Sprache auf de gestellt.
  3. 3.Warten. Rechne mit etwa einer Minute pro Video. Danach liegt eine .txt-Datei pro Aufnahme im Ausgabe-Ordner.

Warum ausgerechnet turbo? OpenAI listet das Modell in der eigenen Modell-Tabelle mit 809 Millionen Parametern und etwa achtfacher Geschwindigkeit im Verhältnis zum large-Modell. Diese Zahl ist ein Richtwert aus fremder Messumgebung. OpenAI hat sie mit englischer Sprache auf einer A100 gemessen und schreibt direkt über der Tabelle, die reale Geschwindigkeit könne je nach Sprache, Sprechtempo und verfügbarer Hardware deutlich abweichen. Bei deutschem Footage auf dem Mac treffen zwei dieser drei Faktoren zu, rechne also nicht mit dem Bestwert. Der dort ebenfalls genannte Bedarf von rund 6 GB VRAM gehört zur PyTorch-Variante mit dedizierter Grafikkarte und sagt für Apple Silicon mit gemeinsamem Speicher wenig aus. Eine Grenze nennt OpenAI dort selbst: turbo ist nicht für Übersetzungs-Aufgaben trainiert. Für deutsches Footage, das deutsch bleiben soll, passt genau dieser Zuschnitt.

Der Anker bei DJI Mimo ist die lange Zahl im Dateinamen, die Session-ID. Alle Dateien mit gleicher Zahl gehören zur selben Aufnahme. _video.mp4 ist die Hauptkamera, _video 2.MP4 der zweite Winkel. Das Script nutzt genau diese ID, um zusammengehörige Clips zu erkennen. Die vollständige, lauffähige Version von transkribieren.py liegt im Download.

Wie ordnest du die Videos den Hooks zu?

Das ist die einzige manuelle Arbeit. Du liest die Transkripte durch und beantwortest vier Fragen:

FrageBedeutet
Zwei Videos sagen fast dasselbe?Gleicher Hook, verschiedene Takes
Verschiedene Themen oder Einstiege?Verschiedene Hook-Nummern
Kurzes "Kauf jetzt"-Video?CTA zu einem längeren Intro
Gleiche Session-ID, verschiedene Dateien?Verschiedene Kamerawinkel

Daraus ergibt sich das Namensschema: hook_[nr]_[thema]_take_[x]_cam[y].mp4. Schreib die Zuordnung zuerst auf Papier, dann erst befüllst du das Script. Stumpf ist Trumpf.

Wie benennst du um, ohne Chaos zu riskieren?

Nicht per Hand Datei für Datei. Du pflegst eine rename_map: alter Dateiname links, neuer Name rechts. Ein kleines Script geht die Zuordnung durch, benennt jede vorhandene Datei um und meldet dir am Ende, was gefunden wurde und was nicht (✗ NICHT GEFUNDEN). So bleibt jeder Schritt nachvollziehbar und du überschreibst nichts blind.

Direkt danach räumst du Duplikate weg. DJI Mimo exportiert manchmal denselben Kamerawinkel doppelt. Ein Hash-Vergleich (MD5 über den Dateiinhalt) findet identische Videos zuverlässig und zeigt dir, welche du löschen kannst. Für diesen Zweck reicht MD5, und die deutschsprachige Wikipedia beschreibt genau diesen Anwendungsfall: Identische Hashwerte bestätigen die Integrität einer Datei, Sicherheit gegen gezielte Manipulation durch einen Angreifer bieten sie nicht. Kollisionen lassen sich seit August 2004 systematisch erzeugen, IETF und BSI raten deshalb von MD5 ab. Beim Dubletten-Zählen auf der eigenen Festplatte greift dich niemand an. Beide Scripte, umbenennen.py und duplikate.py, sind im Pack fertig zum Kopieren.

Wie machst du das Archiv durchsuchbar?

Zum Schluss legst du eine Video-Transkripte.md im Projektordner an. Die Struktur ist simpel: eine H1 mit Kunde und Datum, dann pro Hook eine H2, darunter pro Take eine H3 mit dem Transkript als Zitat. So:

# Video-Transkripte · [Kunde] · [Datum]
## hook_01_struktur
### hook_01_struktur_take_1
> Deine Struktur schlägt dein Einkommen...

Damit ist dein Asset-Archiv komplett durchsuchbar. Für dich, für deinen Editor, für jedes KI-Tool, das später darauf zugreift.

Wie viel Zeit kostet das?

SchrittWerZeit
Installation (einmalig)Du10 min
Videos kopierenDu5 min
TranskriptionScript~1 min pro Video
Gruppen bildenDu20-30 min
UmbenennenScript1 min
Duplikate prüfenScript1 min
Obsidian-NoteDu10 min

Gesamt: 45 bis 60 Minuten für einen kompletten Videotag. Danach nie wieder Fragezeichen.

Warum funktioniert das?

mlx-whisper läuft lokal, also fallen weder Cloud-Kosten noch Datenschutzfragen an. ffmpeg extrahiert das Audio schnell, bevor Whisper es verarbeitet. Die Session-ID im DJI-Dateinamen ist der Anker, an dem zusammengehörige Kamerawinkel hängen. Und das Namensschema macht dein Archiv sofort lesbar, für Editoren, Freelancer und KI-Tools gleichermaßen. Ende der Durchsage.

Das Archiv ist kein Selbstzweck. Die sauber benannten Takes sind das Rohmaterial für deine Anzeigen, und wie du die Produktion drumherum automatisierst, steht im Beitrag Meta Ads automatisieren mit Claude Code. Damit die Transkripte danach nicht nach Standard-KI klingen, hilft Dein KI-Content klingt nach ChatGPT, nicht nach dir. Und wenn aus dem Material am Ende Anfragen werden sollen, ohne dass du Leute einstellst, zeigt KI-Funnel für Coaches, wie die Teile ineinandergreifen.

Was steckt im PDF? Die drei vollständigen, lauffähigen Python-Scripte (transkribieren.py, umbenennen.py, duplikate.py), die Installationsbefehle für Homebrew, ffmpeg und mlx-whisper zum Kopieren und die fertige Vorlage für die Obsidian-Note. Auf dieser Seite steht das Prinzip, im PDF steht der Code. Du bekommst es oben über das Formular, kostenlos gegen deine E-Mail-Adresse.

Kostenlos herunterladen

Das Download-Pack liefert die drei vollständigen, lauffähigen Python-Scripte (transkribieren.py, umbenennen.py, duplikate.py) plus die Homebrew/ffmpeg/mlx-whisper-Installationsbefehle und die fertige Obsidian-Note-Vorlage zum Kopieren.

Name + E-Mail, kein Spam, kein Abo. Du erhältst das PDF direkt per E-Mail.

Mit dem Absenden stimmst du zu, gelegentlich relevante Inhalte von adcompany zu erhalten. Abmeldung jederzeit. Datenschutz

Häufige Fragen

Brauche ich für die Transkription eine Internetverbindung oder Cloud?

Nein. mlx-whisper läuft komplett lokal auf deinem Mac mit Apple Silicon. Keine Cloud, keine API-Kosten, kein Datenschutzproblem.

Funktioniert das auch auf einem Windows-PC oder Intel-Mac?

Der Guide setzt einen Mac mit Apple Silicon (M1 bis M4) voraus, weil mlx-whisper auf diese Chips optimiert ist. Für andere Systeme brauchst du eine andere Whisper-Variante.

Woran erkenne ich zusammengehörige Kamerawinkel bei DJI Mimo?

An der langen Zahl im Dateinamen, der Session-ID. Alle Dateien mit gleicher Zahl gehören zur selben Aufnahme. _video.mp4 ist die Hauptkamera, _video 2.MP4 der zweite Winkel.

Wie lange dauert die Organisation für einen ganzen Videotag?

Rund 45 bis 60 Minuten insgesamt. Die Transkription läuft dabei automatisch mit etwa einer Minute pro Video, die manuelle Zuordnung der Gruppen kostet 20 bis 30 Minuten.

Warum sollte ich die Zuordnung erst auf Papier schreiben?

Weil das Gruppieren die einzige manuelle Entscheidung ist. Wer erst die Hook-Take-Zuordnung notiert und dann die rename_map befüllt, macht weniger Fehler, als wer direkt im Script tippt.

Passend dazu

NO-CODE Mastery (997 € netto): KI-Agenten und Automationen ohne ProgrammierungMeta Ads automatisieren mit Claude Code: 30-Punkte-SetupDein KI-Content klingt nach ChatGPT, nicht nach dirKI-Funnel für Coaches: Mehr Leads ohne mehr Mitarbeiter