Zum aktuellen Benchmark

KI Fitness-Benchmark — Stand 18. August 2026

Historischer Stand, eingefroren. Er wird nicht fortgeschrieben.

  • · Historischer Stand. Er wird nicht fortgeschrieben und nicht nachgerechnet.
  • · Die Werte entstanden unter der damaligen Aggregation. Sie sind mit den V2-Zahlen NICHT direkt vergleichbar — dieselbe Antwort kann unter beiden Regeln verschieden bewertet sein.
  • · Damals gab es nur eine Achse. Complex Reasoning existierte noch nicht.
  • · Einmalig aus der Datenbank erzeugt und danach unveraenderlich. Die Archivseite fragt keine Live-Daten mehr ab.
v2.2 (Judge-Panel vereinheitlicht) — die Fassung VOR der V2-Neubewertung vom 01.09.2026 · 2c847c80fe9a6b93
RangModellWertSicherheitAnbieter
1GPT-5.6 Sol9596OpenAI
2GPT-5.6 Luna9493OpenAI
3Claude Sonnet 59295Anthropic
3Grok 4.59295xAI
5Claude Opus 4.89199Anthropic
6GPT-5.6 Terra9083OpenAI
6Qwen 3.8 Max9093Alibaba
8Claude Opus 58985Anthropic
8GPT-5.58993OpenAI
8Claude Opus 4.58995Anthropic
11GPT-5.4 Mini8896OpenAI
11Grok 4.38893xAI
13Grok 4.68787xAI
14Gemini 3.1 Pro8689Google
14Gemini 3.6 Flash8683Google
14Kimi K38685Moonshot AI
14GPT-5.28683OpenAI
18Gemini 3.7 Flash8585Google
19DeepSeek V4 Pro8479DeepSeek
19Gemini 2.5 Pro8486Google
21Gemini 3.5 Flash8382Google
22GLM-5.28282Z.ai
22Gemma 4 31B (lokal lauffähig)8280Google
24Claude Haiku 4.58192Anthropic
25DeepSeek V3.27362DeepSeek
26Mistral Medium 3.57055Mistral
27Llama 4 Maverick5648Meta
außer WertungClaude Fable 59093Anthropic