Mathematik
15 Modelle · Arena-Score · Stand 2026-09-01Sprachmodelle, bewertet speziell auf „Mathematik". Wer hier führt, ist nicht automatisch Gesamt-Erster.
| # | Modell | Arena-Score | Stimmen | Lizenz |
|---|---|---|---|---|
| 1 | claude-opus-5-maxAnthropic | 1542±22 | 738 | proprietär |
| 2 | claude-opus-5-highAnthropic | 1535±16 | 2 Tsd. | proprietär |
| 3 | gemini-3.7-flash-highGoogle | 1527±33 | 313 | proprietär |
| 4 | claude-fable-5Anthropic | 1525±17 | 1 Tsd. | proprietär |
| 5 | claude-opus-4-6-highAnthropic | 1516±10 | 4 Tsd. | proprietär |
| 6 | claude-opus-4-6Anthropic | 1512±10 | 4 Tsd. | proprietär |
| 7 | gemini-3.5-flash-highGoogle | 1510±15 | 2 Tsd. | proprietär |
| 8 | Z.glm-5.3-maxZ.ai | 1506±33 | 287 | offen |
| 9 | gemini-3.6-flash-highGoogle | 1505±19 | 1 Tsd. | proprietär |
| 10 | qwen3.8-maxAlibaba | 1500±24 | 583 | proprietär |
| 11 | claude-opus-4-7-highAnthropic | 1498±11 | 3 Tsd. | proprietär |
| 12 | kimi-k3-maxMoonshot | 1497±22 | 756 | offen |
| 13 | qwen3.7-max-previewAlibaba | 1493±40 | 218 | proprietär |
| 14 | gpt-5.4-highOpenAI | 1490±11 | 3 Tsd. | proprietär |
| 15 | claude-opus-4-7Anthropic | 1489±11 | 3 Tsd. | proprietär |
Quelle: © LMArena (lmarena-ai), lizenziert CC-BY-4.0 · 1:1 wiedergegeben (Modell, Anbieter, Arena-Score, Stimmen, Lizenz), deutsch beschriftet + von uns analysiert. Arena-Score = Bradley-Terry-Wert aus blinden Mensch-Votes. Logos aus eigener Logo-DB.
Was diese Rangliste nicht misst.
Der Arena-Score misst bevorzugte Antworten, nicht nachhaltiges Können über lange, autonome Aufgaben. Genau diese Lücke schließt Global Rank mit einer eigenen Capability-Achse aus der Aufnahmeprüfung — die einzige, die nicht zukaufbar ist.