ai newsSo., 4. Okt.
← Alle Tipps

Lokale Modelle mit Ollama: Cloud vs. eigener Rechner

Self-Hosting · 6 Min. Lesezeit · Stand 04.10.2026

Ollama installieren, passende Modellgröße zur Hardware wählen, Grenzen kennen - und wissen, wann lokale Modelle gegen Cloud-APIs wirklich gewinnen.

Lokale Modelle sind kostenlos pro Token, laufen offline und schicken nichts raus. Der Preis: Hardware-Grenzen und meist spürbar schlechtere Qualität als die großen Cloud-Modelle. Wann sich das lohnt, hängt vom Anwendungsfall ab.

Start mit Ollama

Ollama ist die pragmatischste Runtime für lokale Modelle auf Mac, Linux und Windows:

ollama pull qwen3:30b   # nur herunterladen
ollama run llama3.1     # laden und direkt chatten

Die Modellbibliothek liegt auf ollama.com/library. Nach dem Start lauscht Ollama standardmäßig auf http://localhost:11434 und spricht eine OpenAI-kompatible API - bestehende Skripte lassen sich also mit einem geänderten Base-URL auf lokal umbiegen.

Welches Modell zur Hardware?

Faustformel für quantisierte Modelle (Q4): rund 0,6 bis 0,7 GB RAM je Milliarde Parameter, plus 1 bis 2 GB Puffer für den Kontext.

Besonders interessant sind Mixture-of-Experts-Modelle wie Qwen3 30B A3B: Nur ein Bruchteil der Parameter ist pro Token aktiv, dadurch laufen sie so schnell wie ein 3B-Modell und antworten trotzdem auf 30B-Niveau. Empfehlenswerte Ausgangspunkte 2026: Qwen3 30B A3B (Alltag und Coding), Gemma 3 12B/27B (Vision, gute Sprachqualität), Llama 3.1 8B (schwache Hardware).

Wo lokal gewinnt

Wo die Cloud gewinnt

Ein bewährtes Setup ist hybrid: lokale Modelle für Vorverarbeitung, Klassifikation und private Daten, Cloud-Modelle für die schweren Schritte. Über einen Router (etwa OpenRouter oder ein eigenes Proxy-Skript) entscheidet eine Regel pro Task, wohin die Anfrage geht.

Praxis-Tipps

Starte mit dem Modell, das gerade noch in den RAM passt, nicht mit dem größten, das theoretisch reinwill - Swapping macht jede Inferenz zur Geduldsprobe. Halte den Kontext klein (lokal zählt jeder Token doppelt: Zeit und Speicher), und nutze ollama ps, um zu sehen, welche Modelle gerade geladen sind. Für Vision-Aufgaben brauchst du ein multimodales Modell wie Gemma 3; reine Text-Modelle ignorieren Bilder still.