Jede Zeile ist eine Kombination aus einem Modell und einer Denkstufe. So kannst du quer über Claude, Gemini und ChatGPT vergleichen: wie klug, wie teuer, wofür geeignet.
Datenstand: 9. August 2026 · Preise in US-Dollar pro 1 Million Tokens
Rechts = teurer, oben = klüger. Die gestrichelte Linie verbindet die Kombinationen, für die es nichts Besseres zum gleichen oder kleineren Preis gibt. Diese sind beschriftet. Fahre mit der Maus über einen Punkt für Details.
Für jede Aufgabenart die günstigste Kombination, die klug genug ist — einmal insgesamt, einmal je Anbieter. Rechnet mit deinen Schiebereglern oben.
Klick auf eine Spaltenüberschrift zum Sortieren. Grau = geschätzt, alles andere ist gemessen oder vom Anbieter veröffentlicht.
Der Klugheits-Wert (0–100) ist der Artificial-Analysis-Intelligence-Index vom 7. August 2026. Das ist kein einzelner Test, sondern ein Mischwert aus vielen Prüfungen. Er ist der einzige Wert, der alle drei Anbieter auf derselben Skala misst — deshalb ist er hier die gemeinsame Messlatte.
Der veröffentlichte Wert gilt hier als Stufe „high". Für die anderen Denkstufen gibt es keine offiziellen Einzelwerte — niemand veröffentlicht „Opus 5 auf low = X". Deshalb rechnet diese Seite mit festen Auf- und Abschlägen. Die sind geschätzt, aber offen und für alle Modelle gleich:
| Stufe | Punkte | Denk-Tokens |
|---|---|---|
| minimal | −12 | 0 |
| low | −7 | 1 500 |
| medium | −3 | 4 000 |
| high | 0 (Basis) | 10 000 |
| xhigh / Extra High | +1,5 | 20 000 |
| max / Deep Think / ultra | +2,5 | 40 000 |
Die Form dieser Kurve entspricht dem, was die Anbieter selbst beschreiben: nach oben hin wird es schnell teuer und nur noch wenig besser. Der Sprung von low auf high bringt viel, der von xhigh auf max wenig.
Die Kosten pro Anfrage rechnen sich so: Eingabe-Tokens × Eingabepreis + (Ausgabe-Tokens + Denk-Tokens) × Ausgabepreis. Wichtig: Denken kostet Ausgabepreis. Bei allen drei Anbietern werden die unsichtbaren Denk-Tokens zum teuren Ausgabetarif abgerechnet. Genau deshalb macht die Denkstufe preislich so viel aus, obwohl der Tokenpreis selbst sich nicht ändert.
Was gemessen ist: alle Preise, alle Kontextgrößen, welche Stufen es überhaupt gibt, und die Basis-Klugheit der Modelle, die im Index stehen (Opus 5, Fable 5, Sonnet 5, Opus 4.8, GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.5, Gemini 3.1 Pro).
Was geschätzt ist: die Basis-Klugheit der Modelle ohne Index-Eintrag (Haiku 4.5, Gemini 3.6 Flash, beide Flash-Lite, GPT-5.6 Luna, GPT-5.5 Pro, Deep Think, Ultra) sowie jede Zahl, die von einer anderen Stufe als „high" kommt. Diese Werte sind in der Tabelle grau markiert. Sie sind gute Hausnummern für einen Vergleich, aber keine Messwerte.
Ein Vorbehalt: Ein einzelner Mischwert kann nicht sagen, ob ein Modell zu deinen Aufgaben passt. Gemini 3.6 Flash liegt im Index unter Gemini 3.1 Pro, schlägt es aber bei Programmier-Tests (SWE-Bench Pro: 58,7 % gegen 54,2 %). Nimm die Punktzahl als grobe Einordnung, nicht als Urteil.