Wie einig sind sich die KI-Juroren?
Claude Opus 5 und GPT-5.6 Sol, die die meisten Urteile liefern, zeigen bei rund neun von zehn Modellpaaren in dieselbe Richtung. Die Unterschiede liegen woanders: Sol erklärt fast nie ein Unentschieden, Claude Fable 5.1 bis zu einmal in sechs Fällen, und Claude Opus 4.8 stimmt den anderen nur in zwei von drei Fällen zu.
Die Rangliste führt die Urteile von fünf KI-Juroren zusammen. Das ist nur sinnvoll, wenn sie sich meistens einig sind. Sind sie das?
Wir haben es so gemessen, wie es ein Leser täte: Gibt es für jedes Modellpaar, das zwei Juroren jeweils mindestens viermal gesehen haben, bei beiden Juroren demselben Modell die Mehrheit der Punkte? Paare, die bei einem der Juroren exakt gleichauf enden, bleiben außen vor. Datenstand 19. September 2026.
Die zwei großen Juroren sind sich in neun von zehn Fällen einig
Claude Opus 5 und GPT-5.6 Sol haben je Sprache rund 2 750 Modellpaare gemeinsam beurteilt. Sie entscheiden sich in 88,5 % der Fälle in Englisch, 91,6 % in Französisch, 91,6 % in Deutsch und 91,1 % in Spanisch für dasselbe Modell.
Zwei Juroren verschiedener Unternehmen, trainiert auf verschiedenen Daten, die bei neun von zehn Paaren zum selben Urteil kommen: Das ist der stärkste Beleg dieses Rankings dafür, dass seine Rangliste etwas Reales über das Schreiben misst und nicht den Geschmack eines einzelnen Modells. Beim zehnten Paar sitzen die interessanten Fragen, und wir werden diese Meinungsverschiedenheiten als Liste veröffentlichen.
Die kleineren Juroren
| Jurorenpaar | Englisch | Französisch | Deutsch | Spanisch |
|---|---|---|---|---|
| Claude Fable 5.1 × Claude Opus 5 | 91,3 % (69) | 95,8 % (71) | 92,4 % (79) | 88,6 % (70) |
| Claude Fable 5.1 × GPT-5.6 Sol | 76,1 % (71) | 82,2 % (73) | 85,4 % (82) | 76,4 % (72) |
| Claude Fable 5 × Claude Opus 5 | 75,5 % (49) | 91,8 % (49) | 91,5 % (47) | 95,0 % (40) |
| Claude Fable 5 × GPT-5.6 Sol | 86,0 % (50) | 90,2 % (51) | 91,3 % (46) | 94,9 % (39) |
| Claude Opus 4.8 × Claude Opus 5 | 72,4 % (87) | 66,7 % (24) | 72,1 % (68) | 81,1 % (95) |
| Claude Opus 4.8 × GPT-5.6 Sol | 66,3 % (83) | 71,4 % (21) | 71,0 % (69) | 75,0 % (96) |
| Muse Spark 1.3 × Claude Opus 5 | 93,5 % (108) | 100 % (33) | 90,8 % (65) | — |
| Muse Spark 1.3 × GPT-5.6 Sol | 75,7 % (136) | 92,1 % (38) | 94,9 % (79) | — |
Die Zahl in Klammern ist die Anzahl gemeinsamer Paare; unter hundert sind die Prozentwerte nur Hinweise. Zwei Dinge fallen auf. Claude Opus 4.8, die vorige Opus-Generation, stimmt den aktuellen Juroren nur in zwei von drei Fällen zu: Seine Urteile wirken wie ein früherer Geschmack, weshalb es heute ein zurückgezogener Juror mit kleinem Anteil ist. Und Claude Fable 5.1 stimmt häufiger mit Claude Opus 5 überein als mit GPT-5.6 Sol, eine Familienähnlichkeit, die ein gutes Ranking im Auge behalten sollte.
Nicht jeder Juror meint mit „besser“ dasselbe
Die Juroren unterscheiden sich auch darin, wie oft sie sich nicht entscheiden:
| Juror | Urteile je Sprache | Unentschieden-Quote (EN / FR / DE / ES) |
|---|---|---|
| GPT-5.6 Sol | ≈ 25 000 | 0,5 % / 0,1 % / 0,1 % / 0,2 % |
| Claude Opus 5 | ≈ 28 000 | 5,4 % / 2,4 % / 3,3 % / 3,3 % |
| Claude Opus 4.8 | 400 – 1 100 | 3,7 % / 0,5 % / 1,5 % / 5,4 % |
| Muse Spark 1.3 | ≈ 6 000 | 9,7 % / 6,9 % / 9,6 % / 9,7 % |
| Claude Fable 5 | ≈ 1 000 | 10,2 % / 5,4 % / 4,0 % / 7,7 % |
| Claude Fable 5.1 | ≈ 1 800 | 15,6 % / 6,6 % / 12,0 % / 9,5 % |
GPT-5.6 Sol kürt fast immer einen Sieger. Claude Fable 5.1 erklärt bei jedem sechsten englischen Duell ein Unentschieden. Keiner von beiden liegt falsch: Ein Unentschieden ist eine legitime Antwort, wenn zwei Texte gleich gut sind, und englische Duelle zwischen Spitzenmodellen sind das oft. Aber ein „Sieg“ unter Sol ist damit eine schwächere Aussage als ein „Sieg“ unter Fable 5.1. Das ist einer der Gründe, warum die Hauptrangliste eine Bradley–Terry-Anpassung über Urteile verwendet, bei der ein Unentschieden für jede Seite einen halben Sieg zählt, statt die 0–100-Noten der Juroren zu mitteln.
Was wir daraus machen
Die Liste der Paare veröffentlichen, bei denen Opus 5 und Sol sich widersprechen, samt Texten, damit die Leser der dritte Juror sein können. Claude Opus 4.8 aus neuen Urteilen heraushalten. Und künftige Juroren danach gewichten, wie gut sie mit dem Pool übereinstimmen, bevor ihre Urteile die Rangliste verändern, nicht danach.