Die Rangliste führt die Urteile von fünf KI-Juroren zusammen. Das ist nur sinnvoll, wenn sie sich meistens einig sind. Sind sie das?

Wir haben es so gemessen, wie es ein Leser täte: Gibt es für jedes Modellpaar, das zwei Juroren jeweils mindestens viermal gesehen haben, bei beiden Juroren demselben Modell die Mehrheit der Punkte? Paare, die bei einem der Juroren exakt gleichauf enden, bleiben außen vor. Datenstand 19. September 2026.

Die zwei großen Juroren sind sich in neun von zehn Fällen einig

Claude Opus 5 und GPT-5.6 Sol haben je Sprache rund 2 750 Modellpaare gemeinsam beurteilt. Sie entscheiden sich in 88,5 % der Fälle in Englisch, 91,6 % in Französisch, 91,6 % in Deutsch und 91,1 % in Spanisch für dasselbe Modell.

Zwei Juroren verschiedener Unternehmen, trainiert auf verschiedenen Daten, die bei neun von zehn Paaren zum selben Urteil kommen: Das ist der stärkste Beleg dieses Rankings dafür, dass seine Rangliste etwas Reales über das Schreiben misst und nicht den Geschmack eines einzelnen Modells. Beim zehnten Paar sitzen die interessanten Fragen, und wir werden diese Meinungsverschiedenheiten als Liste veröffentlichen.

Die kleineren Juroren

Jurorenpaar Englisch Französisch Deutsch Spanisch
Claude Fable 5.1 × Claude Opus 5 91,3 % (69) 95,8 % (71) 92,4 % (79) 88,6 % (70)
Claude Fable 5.1 × GPT-5.6 Sol 76,1 % (71) 82,2 % (73) 85,4 % (82) 76,4 % (72)
Claude Fable 5 × Claude Opus 5 75,5 % (49) 91,8 % (49) 91,5 % (47) 95,0 % (40)
Claude Fable 5 × GPT-5.6 Sol 86,0 % (50) 90,2 % (51) 91,3 % (46) 94,9 % (39)
Claude Opus 4.8 × Claude Opus 5 72,4 % (87) 66,7 % (24) 72,1 % (68) 81,1 % (95)
Claude Opus 4.8 × GPT-5.6 Sol 66,3 % (83) 71,4 % (21) 71,0 % (69) 75,0 % (96)
Muse Spark 1.3 × Claude Opus 5 93,5 % (108) 100 % (33) 90,8 % (65)
Muse Spark 1.3 × GPT-5.6 Sol 75,7 % (136) 92,1 % (38) 94,9 % (79)

Die Zahl in Klammern ist die Anzahl gemeinsamer Paare; unter hundert sind die Prozentwerte nur Hinweise. Zwei Dinge fallen auf. Claude Opus 4.8, die vorige Opus-Generation, stimmt den aktuellen Juroren nur in zwei von drei Fällen zu: Seine Urteile wirken wie ein früherer Geschmack, weshalb es heute ein zurückgezogener Juror mit kleinem Anteil ist. Und Claude Fable 5.1 stimmt häufiger mit Claude Opus 5 überein als mit GPT-5.6 Sol, eine Familienähnlichkeit, die ein gutes Ranking im Auge behalten sollte.

Nicht jeder Juror meint mit „besser“ dasselbe

Die Juroren unterscheiden sich auch darin, wie oft sie sich nicht entscheiden:

Juror Urteile je Sprache Unentschieden-Quote (EN / FR / DE / ES)
GPT-5.6 Sol ≈ 25 000 0,5 % / 0,1 % / 0,1 % / 0,2 %
Claude Opus 5 ≈ 28 000 5,4 % / 2,4 % / 3,3 % / 3,3 %
Claude Opus 4.8 400 – 1 100 3,7 % / 0,5 % / 1,5 % / 5,4 %
Muse Spark 1.3 ≈ 6 000 9,7 % / 6,9 % / 9,6 % / 9,7 %
Claude Fable 5 ≈ 1 000 10,2 % / 5,4 % / 4,0 % / 7,7 %
Claude Fable 5.1 ≈ 1 800 15,6 % / 6,6 % / 12,0 % / 9,5 %

GPT-5.6 Sol kürt fast immer einen Sieger. Claude Fable 5.1 erklärt bei jedem sechsten englischen Duell ein Unentschieden. Keiner von beiden liegt falsch: Ein Unentschieden ist eine legitime Antwort, wenn zwei Texte gleich gut sind, und englische Duelle zwischen Spitzenmodellen sind das oft. Aber ein „Sieg“ unter Sol ist damit eine schwächere Aussage als ein „Sieg“ unter Fable 5.1. Das ist einer der Gründe, warum die Hauptrangliste eine Bradley–Terry-Anpassung über Urteile verwendet, bei der ein Unentschieden für jede Seite einen halben Sieg zählt, statt die 0–100-Noten der Juroren zu mitteln.

Was wir daraus machen

Die Liste der Paare veröffentlichen, bei denen Opus 5 und Sol sich widersprechen, samt Texten, damit die Leser der dritte Juror sein können. Claude Opus 4.8 aus neuen Urteilen heraushalten. Und künftige Juroren danach gewichten, wie gut sie mit dem Pool übereinstimmen, bevor ihre Urteile die Rangliste verändern, nicht danach.