Ein Sprachmodell offline zu betreiben heißt: Die Modelldatei liegt auf deiner eigenen Platte, ein kleines Programm namens Ollama öffnet sie und lässt sie rechnen, und ab diesem Moment braucht keine Antwort mehr eine Internetverbindung. Kein Konto, kein Zugangsschlüssel, keine Zahlungsdaten. Die Einrichtung dauert einen Abend und besteht aus sechs Schritten. Diese Seite spielt alle sechs offen aus. Das Blatt zum Ausfüllen liegt im PDF.
Warum sollte ein KI-Modell auf dem eigenen Rechner laufen?
Weil in fast jedem Auftrag, den du einem Modell gibst, etwas steckt, das dir nicht gehört. Der Name deines Kunden. Sein Budget. Manchmal der Grund, warum er letztes Jahr fast abgesprungen wäre. Dieser Text reist in ein Rechenzentrum, meistens in den USA, und du weißt nicht, wo er danach liegt und wie lange.
Wir betreuen 138 Unternehmen und haben 1843 Kampagnen gebaut. Die Frage kommt inzwischen von den Kunden selbst, nicht mehr von uns. Und sie kommt in einen Markt hinein, der längst umgestiegen ist: 26 Prozent der Unternehmen in Deutschland nutzten 2025 Technologien der künstlichen Intelligenz, bei 10 bis 49 Beschäftigten waren es 23 Prozent, ab 250 Beschäftigten 57 Prozent (Statistisches Bundesamt, IKT-Erhebung 2025). Wichtig beim Lesen dieser Zahl: Die Erhebung zählt erst ab 10 Beschäftigten. Solo-Selbstständige, also ein großer Teil unserer Leser, stehen dort gar nicht drin.
Wer wissen will, was ein KI-Werkzeug auf dem eigenen Gerät tatsächlich anfasst, findet die längere Fassung dieser Frage in Was Claude Desktop auf deinem Mac tut. Lokal rechnen ist die andere Hälfte derselben Antwort.
Was passiert technisch, wenn ein Modell lokal läuft?
Es sind zwei Dinge. Mehr nicht.
Erstens eine Datei. Das Modell ist eine einzige große Datei auf deiner Platte. Da drin stehen keine Sätze, sondern Zahlen. Das ist alles, was das Modell beim Training gelernt hat.
Zweitens ein Programm, das diese Datei öffnet und rechnen lässt. Es heißt Ollama. Das Programm ist der Motor, die Datei ist der Treibstoff. t3n beschreibt den Stand so: „Das Open-Source-Tool Ollama hat sich zu einem der wichtigsten Werkzeuge entwickelt, um große Sprachmodelle lokal auf dem eigenen Rechner auszuführen" (t3n, Kim Rixecker, 06.08.2025).
Sobald die Datei einmal auf der Platte liegt, brauchst du kein Netz mehr. Das ist der ganze Trick.
Welche Qwen3-Größe passt zu meinem Rechner?
Qwen3 ist keine einzelne Größe, sondern eine Familie. Der Hersteller hat sie unter Apache-2.0-Lizenz veröffentlicht, mit sechs dichten Modellen (0.6B, 1.7B, 4B, 8B, 14B, 32B) und zwei MoE-Varianten, 30B-A3B und 235B-A22B (Qwen-Team, 29.04.2025). Du brauchst davon genau eine Nummer.
Die Regel dahinter ist simpel: Das Modell braucht seinen Platz auf der Platte und dazu ungefähr dieselbe Menge Arbeitsspeicher plus zwei Gigabyte Luft. Passt es in den Arbeitsspeicher, antwortet es zügig. Passt es nicht, holt sich der Motor die fehlenden Teile beim Rechnen von der Platte nach, und dann wird es zäh.
| Arbeitsspeicher | Deine Nummer | Download |
|---|---|---|
| 8 GB | qwen3:4b | 2,5 GB |
| 16 GB | qwen3:8b | 5,2 GB |
| ab 32 GB | qwen3-coder:30b | 19 GB |
Die Download-Größen stehen in der Ollama-Modellbibliothek und sind der ehrlichere Maßstab als die Parameterzahl im Namen.
Auf einem Raspberry Pi gilt dieselbe Rechnung. Sinnvoll wird es ab der 16-GB-Variante des Pi 5, die es neben 1, 2, 4 und 8 GB offiziell gibt (Raspberry Pi Ltd, Produktseite Pi 5). Und die Platte muss eine SSD über USB oder Steckplatine sein. Auf einer Speicherkarte kriecht das Ganze.
Wie richte ich Qwen3 offline ein? Die sechs Schritte
Schritt 1 · Sieh dir drei Zahlen an deinem Rechner an. Freier Platz auf der Platte. Arbeitsspeicher. Und ob die Platte fest eingebaut ist oder eine Speicherkarte. Aus diesen drei Zahlen folgt deine Modellgröße aus der Tabelle oben. Fast jede Enttäuschung mit lokalen Modellen entsteht hier, weil jemand ein winziges Modell auf eine große Maschine legt und dann das Modell für dumm hält.
Schritt 2 · Installiere den Motor. Auf ollama.com lädst du das Programm für dein System. Auf Mac und Windows ist es ein normaler Installer zum Anklicken, auf Linux und auf dem Raspberry Pi eine einzige Zeile, die auf der Seite steht. Danach öffnest du das Terminal und tippst ollama --version. Kommt eine Nummer zurück, ist der Motor da. Wenn du das Terminal gar nicht anfassen willst: Seit Ende Juli 2025 bietet die Software „zumindest unter Windows und macOS auch eine grafische Benutzeroberfläche an" (t3n, 06.08.2025), alternativ nimmst du LM Studio. Dasselbe mit Fenstern und Knöpfen.
Schritt 3 · Hol das Modell auf die Platte. Ein Befehl mit deiner Nummer aus Schritt 1, also ollama pull qwen3:4b oder ollama pull qwen3:8b oder ollama pull qwen3-coder:30b. An einer normalen Leitung dauert das eine gute halbe bis ganze Stunde. Mit ollama list siehst du danach, was liegt. Neben der Installation aus Schritt 2 ist das der letzte Schritt der Anleitung, der Internet braucht. Starte ihn, solange du daneben sitzt und ein Problem noch bemerkst.
Schritt 4 · Gib ihm einen echten Auftrag. Der Startbefehl ist bei heise so beschrieben: „Der Befehl ollama run <modellname> startet einen Chat mit einem der vielen unterstützten Modelle" (heise online, Ulrich Wolf, 21.03.2025). Dieselbe Übersicht hält fest: „Ollama erkennt vorhandene GPUs von Nvidia und AMD und verwendet sie automatisch." Stell jetzt keine Testfrage, sondern eine Aufgabe, die du wirklich hast. Zähl beim Antworten mit: Kommen die Wörter langsamer, als du sie lesen kannst, nimm die nächstkleinere Nummer.
Schritt 5 · Zieh den Stecker. WLAN aus, Kabel raus, dieselbe Frage noch einmal.
Schritt 6 · Häng es an deine Arbeit und gib ihm deine Regeln. Der Motor läuft im Hintergrund und nimmt Anfragen auf deinem eigenen Rechner entgegen. In der Ollama-Dokumentation steht die Adresse dafür: „After installation, Ollama's API is served by default at: http://localhost:11434/api" (Ollama API-Doku). Das ist der Hausanschluss, an dem alles andere andockt: dein Editor, deine Chat-Oberfläche, deine kleinen Skripte. Dann legst du eine Textdatei an und schreibst hinein, wie du arbeitest, welche Sprache, welcher Stil, was das Modell nie tun soll. Diese Datei gibst du bei jedem Auftrag mit. Wie aus so einem Merkzettel eine ganze Arbeitsumgebung wird, steht im Agent Dev Kit für Claude Code.
Woran erkenne ich, dass wirklich kein Byte nach draußen geht?
An Schritt 5, und nur an Schritt 5. Bis dahin glaubst du es, ab da weißt du es. Antwortet das Modell mit ausgeschaltetem Netz überhaupt, kann die Antwort nicht aus einem Rechenzentrum gekommen sein. Mehr beweist der Test nicht: Ob nach dem Wiederverbinden etwas sendet, etwa Ollama selbst, eine Editor-Erweiterung oder ein angeschlossenes Script, zeigt erst ein Blick in die ausgehenden Verbindungen, mit der System-Firewall oder einem Mitschnitt-Werkzeug.
Ein Detail, das dabei irritiert: Der Wortlaut der Antwort wird ein anderer sein als vorhin. Das ist normal und hat mit dem Netz nichts zu tun. Es geht allein darum, dass eine Antwort kommt. Ohne diesen Test hast du eine Behauptung, keinen Beweis.
Was mache ich, wenn ich schon mittendrin stecke?
- ·Du hast schon LM Studio. Überspring Schritt 2, du hast den Motor bereits, nur mit anderer Oberfläche. Steig bei Schritt 3 ein und lade das Modell dort über die Suche.
- ·Du hast schon ein Modell geladen und warst enttäuscht. Prüf zuerst die Größe. Meistens liegt ein 3-Gigabyte-Modell auf einer 32-Gigabyte-Maschine. Zurück auf Schritt 1.
- ·Der Raspberry Pi ist bestellt, aber noch nicht da. Fang trotzdem heute auf dem Rechner an, der vor dir steht. Die sechs Schritte sind auf jeder Maschine dieselben.
- ·Es läuft, aber quälend langsam. Das ist kein Fehler, das ist der übersprungene Schritt 1. Eine Nummer kleiner, und es läuft.
Ist ein Raspberry Pi nicht zu schwach für ein Sprachmodell?
Zum Teil ja, und das sage ich lieber selbst. Der Pi antwortet langsamer als jeder Laptop, man sieht die Wörter einzeln kommen. Für einen Chat, bei dem du wartest, ist das unangenehm.
Der Pi ist der Beweis, nicht die Werkbank. Er zeigt, dass ein ganzes Sprachmodell ohne Rechenzentrum auskommt, für ein paar Watt aus der Steckdose. Gut ist er für Sachen, die über Nacht laufen dürfen. Gearbeitet wird auf dem Rechner, der ohnehin auf deinem Tisch steht.
Der zweite Einwand ist ehrlicher: Bei sehr langen Ketten und riesigen Vorlagen liegt das große Cloud-Modell weiter vorne. Auch das stimmt. Deshalb ist die Regel bei uns nicht „alles lokal", sondern: Was Kundendaten enthält, läuft auf eigener Hardware. Was ohnehin öffentlich ist, darf in die Cloud.
Was mache ich am ersten Abend damit?
Drei Aufträge, die sofort etwas bringen und alle drei Kundendaten enthalten. Wirf eine echte Kundenliste hinein und lass sie sortieren. Lass ein Angebot gegenlesen, mit Preisen drin, so wie es rausgeht. Lass ein Skript schreiben, das deine Auswertungen zusammenfasst.
Genau diese drei hättest du vorher nicht in ein Cloud-Fenster getippt. Das ist der Unterschied, den du an diesem Abend kaufst. Und wenn dich die Technik drumherum abschreckt: Der ruhigere Einstieg steht in KI-Marketing ohne Code.
Im PDF liegt dieselbe Einrichtung als Blatt zum Ausdrucken: alle sechs Schritte mit voller Erklärung und der Begründung, warum jeder Schritt an genau dieser Stelle steht, die Modell-Leiter zum Nachschlagen, die vier Wiedereinstiege für halb fertige Versuche und die leere Maschinen-Seite mit Feldern für deine drei Zahlen, deine Modellgröße, die sechs Haken zum Abarbeiten, Datum und Uhrzeit deines ersten Laufs ohne Netz und deine eigene Grenze zwischen lokal und Cloud. Ein Blatt pro Rechner, gebrandet und druckfertig, oben über das Formular.
