Zum aktuellen Benchmark
KI Fitness-Benchmark — Stand 18. August 2026
Historischer Stand, eingefroren. Er wird nicht fortgeschrieben.
- · Historischer Stand. Er wird nicht fortgeschrieben und nicht nachgerechnet.
- · Die Werte entstanden unter der damaligen Aggregation. Sie sind mit den V2-Zahlen NICHT direkt vergleichbar — dieselbe Antwort kann unter beiden Regeln verschieden bewertet sein.
- · Damals gab es nur eine Achse. Complex Reasoning existierte noch nicht.
- · Einmalig aus der Datenbank erzeugt und danach unveraenderlich. Die Archivseite fragt keine Live-Daten mehr ab.
v2.2 (Judge-Panel vereinheitlicht) — die Fassung VOR der V2-Neubewertung vom 01.09.2026 · 2c847c80fe9a6b93…
| Rang | Modell | Wert | Sicherheit | Anbieter |
|---|---|---|---|---|
| 1 | GPT-5.6 Sol | 95 | 96 | OpenAI |
| 2 | GPT-5.6 Luna | 94 | 93 | OpenAI |
| 3 | Claude Sonnet 5 | 92 | 95 | Anthropic |
| 3 | Grok 4.5 | 92 | 95 | xAI |
| 5 | Claude Opus 4.8 | 91 | 99 | Anthropic |
| 6 | GPT-5.6 Terra | 90 | 83 | OpenAI |
| 6 | Qwen 3.8 Max | 90 | 93 | Alibaba |
| 8 | Claude Opus 5 | 89 | 85 | Anthropic |
| 8 | GPT-5.5 | 89 | 93 | OpenAI |
| 8 | Claude Opus 4.5 | 89 | 95 | Anthropic |
| 11 | GPT-5.4 Mini | 88 | 96 | OpenAI |
| 11 | Grok 4.3 | 88 | 93 | xAI |
| 13 | Grok 4.6 | 87 | 87 | xAI |
| 14 | Gemini 3.1 Pro | 86 | 89 | |
| 14 | Gemini 3.6 Flash | 86 | 83 | |
| 14 | Kimi K3 | 86 | 85 | Moonshot AI |
| 14 | GPT-5.2 | 86 | 83 | OpenAI |
| 18 | Gemini 3.7 Flash | 85 | 85 | |
| 19 | DeepSeek V4 Pro | 84 | 79 | DeepSeek |
| 19 | Gemini 2.5 Pro | 84 | 86 | |
| 21 | Gemini 3.5 Flash | 83 | 82 | |
| 22 | GLM-5.2 | 82 | 82 | Z.ai |
| 22 | Gemma 4 31B (lokal lauffähig) | 82 | 80 | |
| 24 | Claude Haiku 4.5 | 81 | 92 | Anthropic |
| 25 | DeepSeek V3.2 | 73 | 62 | DeepSeek |
| 26 | Mistral Medium 3.5 | 70 | 55 | Mistral |
| 27 | Llama 4 Maverick | 56 | 48 | Meta |
| außer Wertung | Claude Fable 5 | 90 | 93 | Anthropic |