KI-Modelle & Denkstufen im Vergleich

Jede Zeile ist eine Kombination aus einem Modell und einer Denkstufe. So kannst du quer über Claude, Gemini und ChatGPT vergleichen: wie klug, wie teuer, wofür geeignet.

Datenstand: 9. August 2026 · Preise in US-Dollar pro 1 Million Tokens

Anbieter
Denkstufe
Deine typische Anfrage
Suche

Klugheit gegen Kosten

Rechts = teurer, oben = klüger. Die gestrichelte Linie verbindet die Kombinationen, für die es nichts Besseres zum gleichen oder kleineren Preis gibt. Diese sind beschriftet. Fahre mit der Maus über einen Punkt für Details.

Was nehme ich wofür?

Für jede Aufgabenart die günstigste Kombination, die klug genug ist — einmal insgesamt, einmal je Anbieter. Rechnet mit deinen Schiebereglern oben.

Alle Kombinationen

Klick auf eine Spaltenüberschrift zum Sortieren. Grau = geschätzt, alles andere ist gemessen oder vom Anbieter veröffentlicht.

Wie die Zahlen zustande kommen — und was daran geschätzt ist

Der Klugheits-Wert (0–100) ist der Artificial-Analysis-Intelligence-Index vom 7. August 2026. Das ist kein einzelner Test, sondern ein Mischwert aus vielen Prüfungen. Er ist der einzige Wert, der alle drei Anbieter auf derselben Skala misst — deshalb ist er hier die gemeinsame Messlatte.

Der veröffentlichte Wert gilt hier als Stufe „high". Für die anderen Denkstufen gibt es keine offiziellen Einzelwerte — niemand veröffentlicht „Opus 5 auf low = X". Deshalb rechnet diese Seite mit festen Auf- und Abschlägen. Die sind geschätzt, aber offen und für alle Modelle gleich:

StufePunkteDenk-Tokens
minimal−120
low−71 500
medium−34 000
high0 (Basis)10 000
xhigh / Extra High+1,520 000
max / Deep Think / ultra+2,540 000

Die Form dieser Kurve entspricht dem, was die Anbieter selbst beschreiben: nach oben hin wird es schnell teuer und nur noch wenig besser. Der Sprung von low auf high bringt viel, der von xhigh auf max wenig.

Die Kosten pro Anfrage rechnen sich so: Eingabe-Tokens × Eingabepreis + (Ausgabe-Tokens + Denk-Tokens) × Ausgabepreis. Wichtig: Denken kostet Ausgabepreis. Bei allen drei Anbietern werden die unsichtbaren Denk-Tokens zum teuren Ausgabetarif abgerechnet. Genau deshalb macht die Denkstufe preislich so viel aus, obwohl der Tokenpreis selbst sich nicht ändert.

Was gemessen ist: alle Preise, alle Kontextgrößen, welche Stufen es überhaupt gibt, und die Basis-Klugheit der Modelle, die im Index stehen (Opus 5, Fable 5, Sonnet 5, Opus 4.8, GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.5, Gemini 3.1 Pro).

Was geschätzt ist: die Basis-Klugheit der Modelle ohne Index-Eintrag (Haiku 4.5, Gemini 3.6 Flash, beide Flash-Lite, GPT-5.6 Luna, GPT-5.5 Pro, Deep Think, Ultra) sowie jede Zahl, die von einer anderen Stufe als „high" kommt. Diese Werte sind in der Tabelle grau markiert. Sie sind gute Hausnummern für einen Vergleich, aber keine Messwerte.

Ein Vorbehalt: Ein einzelner Mischwert kann nicht sagen, ob ein Modell zu deinen Aufgaben passt. Gemini 3.6 Flash liegt im Index unter Gemini 3.1 Pro, schlägt es aber bei Programmier-Tests (SWE-Bench Pro: 58,7 % gegen 54,2 %). Nimm die Punktzahl als grobe Einordnung, nicht als Urteil.