Welches Modell wofür? Kosten im Blick behalten
Kosten · 7 Min. Lesezeit · Stand 04.10.2026
Wann sich das teure Flaggschiff lohnt, wann ein kleines Modell reicht und wie Prompt-Caching die Rechnung drückt - mit Preisordnungen statt Versprechen.
Der größte Kostenhebel in der KI-Nutzung ist nicht der Anbieter, sondern die Modellwahl. Der Unterschied zwischen einem Frontier-Modell und einem kleinen schnellen Modell liegt bei ein- und derselben Aufgabe leicht beim Hundertfachen.
Preisordnungen (grobe Größen, Stand Herbst 2026)
Die Preise ändern sich mehrmals im Jahr, deshalb hier nur die Größenordnung - vor einer Kaufentscheidung immer auf der Preisseite des Anbieters prüfen:
- Flaggschiff-Klasse (OpenAI GPT-6, Anthropic Opus, Gemini Pro): typischerweise 2 bis 10 USD pro Million Input-Tokens und 12 bis 50 USD pro Million Output-Tokens.
- Mittelklasse (Sonnet-ähnliche Modelle, kleine GPT/Gemini-Varianten): eher 0,75 bis 3 USD Input und 3 bis 15 USD Output.
- Klein und schnell (Haiku-, Nano-, Flash-Lite-Klasse): Cent-Bereich, teils 0,10 USD Input und 0,50 USD Output.
Output-Tokens kosten fast immer das Vier- bis Sechsfache der Input-Tokens. Lange Denkanstöße (Reasoning- und Thinking-Tokens) zählen als Output und sind damit der stille Kostentreiber bei harten Aufgaben.
Wo das große Modell wirklich nötig ist
- Mehrstufige Agenten-Läufe, in denen ein Fehler sich durch alle Schritte zieht.
- Große Refaktoren und Architekturentscheidungen mit vielen wechselseitigen Abhängigkeiten.
- Schweres Reasoning, Mathe, knifflige Migrationen, Sicherheits-Reviews.
- Kontexte, in denen subtile Anforderungen (Recht, Medizin, Verträge) nicht schiefgehen dürfen.
Wo ein kleines Modell reicht
- Klassifikation, Routing, Extraktion, Tagging ("Ist das eine Beschwerde oder eine Frage?").
- Formatumwandlungen, Zusammenfassungen bekannter Struktur, Übersetzungen von Alltagstexten.
- Batch-Jobs über viele gleichförmige Dokumente.
- Chat-Antworten mit kurzer Latenz, Autocomplete, Titel-Generierung.
Faustregel: Erst mit dem kleinen Modell probieren, das Ergebnis messen, dann hochstufen. In Pipelines lohnt sich ein Zwei-Stufen-Muster - kleines Modell filtert und vor, großes Modell entscheidet nur bei den schwierigen 10 Prozent.
Prompt-Caching: der unterschätzte Hebel
Caching bewahrt wiederholte Präfixe auf (System-Prompt, Tool-Definitionen, lange Dokumente) und macht daraus rund 10 Prozent des Input-Preises. Das bringt je nach Anbieter 75 bis 90 Prozent Ersparnis auf den gecachten Teil:
- Bei OpenAI und DeepSeek passiert das automatisch ab einer Mindest-Promptlänge.
- Anthropic will einen
cache_control-Marker (bis zu vier Breakpoints pro Prompt, optional 1 Stunde Haltbarkeit). - Google unterstützt implizites und explizites Caching, bei langen Cache-Zeiten fällt eine Stundengebühr an.
Damit der Cache trifft: stabile Teile an den Prompt-Anfang, Variablen (Datum, IDs, die eigentliche Frage) ans Ende. Ein einzelnes wechselndes Token in der Mitte invalidiert alles dahinter. In Agenten-Alltagen, wo der gleiche System-Prompt hunderte Male pro Tag geht, ist das oft die größte Einzelersparnis - noch vor dem Modellwechsel.
Kontrollieren statt hoffen
Setze Ausgabelimits pro API-Key, logge usage.cost aus jeder Antwort, und evaluiere bei Modellwechseln mit einer kleinen eigenen Testmenge statt Marketing-Benchmarks. Die Preisseiten der Anbieter (Anthropic, OpenAI, Google) sind die einzige verlässliche Quelle - alles andere altert in Wochen.