ai newsSo., 4. Okt.
← Alle Tipps

Welches Modell wofür? Kosten im Blick behalten

Kosten · 7 Min. Lesezeit · Stand 04.10.2026

Wann sich das teure Flaggschiff lohnt, wann ein kleines Modell reicht und wie Prompt-Caching die Rechnung drückt - mit Preisordnungen statt Versprechen.

Der größte Kostenhebel in der KI-Nutzung ist nicht der Anbieter, sondern die Modellwahl. Der Unterschied zwischen einem Frontier-Modell und einem kleinen schnellen Modell liegt bei ein- und derselben Aufgabe leicht beim Hundertfachen.

Preisordnungen (grobe Größen, Stand Herbst 2026)

Die Preise ändern sich mehrmals im Jahr, deshalb hier nur die Größenordnung - vor einer Kaufentscheidung immer auf der Preisseite des Anbieters prüfen:

Output-Tokens kosten fast immer das Vier- bis Sechsfache der Input-Tokens. Lange Denkanstöße (Reasoning- und Thinking-Tokens) zählen als Output und sind damit der stille Kostentreiber bei harten Aufgaben.

Wo das große Modell wirklich nötig ist

Wo ein kleines Modell reicht

Faustregel: Erst mit dem kleinen Modell probieren, das Ergebnis messen, dann hochstufen. In Pipelines lohnt sich ein Zwei-Stufen-Muster - kleines Modell filtert und vor, großes Modell entscheidet nur bei den schwierigen 10 Prozent.

Prompt-Caching: der unterschätzte Hebel

Caching bewahrt wiederholte Präfixe auf (System-Prompt, Tool-Definitionen, lange Dokumente) und macht daraus rund 10 Prozent des Input-Preises. Das bringt je nach Anbieter 75 bis 90 Prozent Ersparnis auf den gecachten Teil:

Damit der Cache trifft: stabile Teile an den Prompt-Anfang, Variablen (Datum, IDs, die eigentliche Frage) ans Ende. Ein einzelnes wechselndes Token in der Mitte invalidiert alles dahinter. In Agenten-Alltagen, wo der gleiche System-Prompt hunderte Male pro Tag geht, ist das oft die größte Einzelersparnis - noch vor dem Modellwechsel.

Kontrollieren statt hoffen

Setze Ausgabelimits pro API-Key, logge usage.cost aus jeder Antwort, und evaluiere bei Modellwechseln mit einer kleinen eigenen Testmenge statt Marketing-Benchmarks. Die Preisseiten der Anbieter (Anthropic, OpenAI, Google) sind die einzige verlässliche Quelle - alles andere altert in Wochen.