Ein Modell, vier Sprachen, vier verschiedene Ränge
91 Modelle sind in allen vier Sprachen platziert. Die Spitze bewegt sich kaum: Claude Opus 5, Claude Fable 5 und Claude Fable 5.1 stehen überall unter den ersten vier. Darunter ist GLM 5.3 Flash Zehnter in Englisch und 53. in Deutsch, Grok 4.6 25. in Englisch und 61. in Französisch.
Die vier Ausgaben dieses Rankings teilen dieselben Modelle, dieselben Juroren und dasselbe Protokoll. Nur die Aufgaben ändern sich: 240 je Sprache, nativ verfasst. Wenn ein Modell in Englisch auf Platz 10 und in Deutsch auf Platz 53 steht, liegt der Unterschied also nicht an der Methode. Er liegt am Modell.
91 Modellvarianten haben in allen vier Sprachen einen veröffentlichten Score (Datenstand 19. September 2026). So weit reisen sie.
Die Spitze bewegt sich nicht
| Modell | Englisch | Französisch | Deutsch | Spanisch |
|---|---|---|---|---|
| Claude Fable 5 | 3 | 3 | 3 | 3 |
| Claude Opus 5 | 2 | 1 | 1 | 2 |
| Claude Fable 5.1 | 4 | 2 | 2 | 1 |
| GPT-6 Astra | 5 | 6 | 4 | 7 |
| Kimi K3 | 1 | 5 | 5 | 4 |
| Claude Opus 4.8 | 7 | 4 | 8 | 5 |
Sechs Modelle verlassen die ersten acht Plätze nie. Kimi K3 ist das einzige Open-Weight-Modell darunter: Erster in Englisch, Vierter oder Fünfter anderswo. Die Scores erzählen dieselbe Geschichte mit mehr Nuancen: Claude Opus 5 erreicht 93,7 in Englisch und 99,5 in Französisch, was bedeutet, dass das französische Feld für das Modell leichter zu dominieren ist, nicht dass es besser Französisch als Englisch schreibt. Scores sind nur innerhalb einer Sprache vergleichbar.
In der Mitte widersprechen sich die Sprachen
| Modell | Englisch | Französisch | Deutsch | Spanisch | Spanne |
|---|---|---|---|---|---|
| GLM 5.3 Flash | 10 | 27 | 53 | 44 | 43 |
| Qwen3.8 27B Q4_K_M 🏠 | 27 | 17 | 58 | 54 | 41 |
| Ling 3.0 Flash Q4_K_M 🏠 | 66 | 35 | 76 | 66 | 41 |
| Grok 4.6 | 25 | 61 | 53 | 21 | 40 |
| Hy3 | 14 | 43 | 24 | 49 | 35 |
| Seed 2.1 Turbo ↯ | 57 | 28 | 61 | 43 | 33 |
| Laguna S 2.1 UD Q4_K_M 🏠 | 58 | 87 | 91 | 87 | 33 |
GLM 5.3 Flash ist in Englisch ein Top-Ten-Modell und in Deutsch eines der unteren Hälfte. Grok 4.6 ist stark in Englisch und Spanisch, schwach in Französisch und Deutsch. Hy3 ist gut in Englisch und mittelmäßig überall sonst. Das sind keine Stichprobenzufälle: Jedes Modell hat zwischen 1 000 und 1 800 gewertete Duelle je Sprache, und die Konfidenzintervalle sind nur wenige Punkte breit.
Lokale Modelle zeigen dasselbe Muster mit einer Pointe. Qwen3.8 27B in Q4_K_M ist das beste lokale Modell in Französisch (Platz 17 insgesamt) und eines der schwächsten in Deutsch (Platz 58). Dieselbe Datei, dieselbe Maschine, dieselbe Reasoning-Einstellung. Was Qwen über Französisch gelernt hat, hat es über Deutsch nicht gelernt.
Die Sprachen sind nicht gleich schwer
Der Abstand zwischen dem besten Cloud-Modell und dem besten lokalen Modell ist in Deutsch und Spanisch am größten:
| Ausgabe | Bestes Modell | Bestes lokales Modell | Rang des lokalen |
|---|---|---|---|
| Englisch | Kimi K3, 93,8 | Muse Glimmer 30B K-Quant Dynamic, 77,6 | 18 |
| Französisch | Claude Opus 5, 99,5 | Qwen3.8 27B Q4_K_M, 76,5 | 17 |
| Deutsch | Claude Opus 5, 98,2 | Gemma 4 31B Q8_0, 71,8 | 26 |
| Spanisch | Claude Fable 5.1, 98,5 | Qwen3.8 27B Q8_0, 70,7 | 23 |
Und das beste lokale Modell ist in jeder Sprache ein anderes. Muse Glimmer gewinnt Englisch, Qwen3.8 Französisch und Spanisch, Gemma 4 31B Deutsch. Wer nur eine Rangliste liest, würde das nie erraten.
Was daraus folgt
Eine englische Rangliste zu lesen, um ein Modell für deutsche Texte zu wählen, ist bei etwa einem Drittel des Feldes ein Fehler. Die geschlossenen Spitzenmodelle sind in jeder getesteten Sprache sicher. Darunter lohnt der Blick in die Ausgabe Ihrer Sprache, und wer Modelle lokal betreibt, sollte die genaue Quantisierung prüfen: Die Datei, die in einer Sprache gewinnt, kann in der nächsten verlieren.