Lokale Modelle mit Ollama: Cloud vs. eigener Rechner
Self-Hosting · 6 Min. Lesezeit · Stand 04.10.2026
Ollama installieren, passende Modellgröße zur Hardware wählen, Grenzen kennen - und wissen, wann lokale Modelle gegen Cloud-APIs wirklich gewinnen.
Lokale Modelle sind kostenlos pro Token, laufen offline und schicken nichts raus. Der Preis: Hardware-Grenzen und meist spürbar schlechtere Qualität als die großen Cloud-Modelle. Wann sich das lohnt, hängt vom Anwendungsfall ab.
Start mit Ollama
Ollama ist die pragmatischste Runtime für lokale Modelle auf Mac, Linux und Windows:
ollama pull qwen3:30b # nur herunterladen
ollama run llama3.1 # laden und direkt chattenDie Modellbibliothek liegt auf ollama.com/library. Nach dem Start lauscht Ollama standardmäßig auf http://localhost:11434 und spricht eine OpenAI-kompatible API - bestehende Skripte lassen sich also mit einem geänderten Base-URL auf lokal umbiegen.
Welches Modell zur Hardware?
Faustformel für quantisierte Modelle (Q4): rund 0,6 bis 0,7 GB RAM je Milliarde Parameter, plus 1 bis 2 GB Puffer für den Kontext.
- 8 GB RAM: 7-8B-Modelle, etwa Llama 3.1 8B oder Qwen3 8B.
- 16 GB: rund 14B.
- 24 GB: 27-32B, etwa Gemma 3 27B (mit Vision) oder Qwen3 30B A3B.
- 64 GB und mehr: bis 70B (Llama 3.3 70B), gern auch auf CPU langsam nutzbar.
Besonders interessant sind Mixture-of-Experts-Modelle wie Qwen3 30B A3B: Nur ein Bruchteil der Parameter ist pro Token aktiv, dadurch laufen sie so schnell wie ein 3B-Modell und antworten trotzdem auf 30B-Niveau. Empfehlenswerte Ausgangspunkte 2026: Qwen3 30B A3B (Alltag und Coding), Gemma 3 12B/27B (Vision, gute Sprachqualität), Llama 3.1 8B (schwache Hardware).
Wo lokal gewinnt
- Datenschutz-kritische Daten, die den Rechner nicht verlassen dürfen.
- Große Batch-Jobs mit vielen gleichförmigen, einfachen Aufgaben (Kosten: 0).
- Offline-Szenarien: Flugzeug, Camping, abgeschottetes Netz.
- Experimentieren ohne Rechnungsangst - Modell laden, ausprobieren, löschen.
Wo die Cloud gewinnt
- Komplexe Coding-Aufgaben und agentische Läufe: Hier liegen Frontier-Modelle deutlich vorn, der Qualitätsunterschied ist nicht marginal.
- Sehr lange Kontexte: 100k+ Tokens lokal zu halten kostet RAM und Geschwindigkeit.
- Spitzengeschwindigkeit auf Alltags-Hardware.
Ein bewährtes Setup ist hybrid: lokale Modelle für Vorverarbeitung, Klassifikation und private Daten, Cloud-Modelle für die schweren Schritte. Über einen Router (etwa OpenRouter oder ein eigenes Proxy-Skript) entscheidet eine Regel pro Task, wohin die Anfrage geht.
Praxis-Tipps
Starte mit dem Modell, das gerade noch in den RAM passt, nicht mit dem größten, das theoretisch reinwill - Swapping macht jede Inferenz zur Geduldsprobe. Halte den Kontext klein (lokal zählt jeder Token doppelt: Zeit und Speicher), und nutze ollama ps, um zu sehen, welche Modelle gerade geladen sind. Für Vision-Aufgaben brauchst du ein multimodales Modell wie Gemma 3; reine Text-Modelle ignorieren Bilder still.