Bevorzugen KI-Juroren ihr eigenes Modell?
Zwei unserer fünf Juroren geben ihrem eigenen Modell einen deutlichen Bonus: GPT-5.6 Sol bewertet seine Texte um bis zu 21 Punkte besser als die anderen Juroren, Claude Opus 5 um bis zu 11. Die beiden Fable-Juroren tun das Gegenteil und benoten sich selbst strenger.
Jeder KI-Juror dieses Rankings sieht zwei anonyme Texte und wählt den besseren. Anonym für den Juror, wohlgemerkt. Wir wissen, wer welchen Text geschrieben hat, und können deshalb eine Frage stellen, die der Juror nicht stellen kann: Ändert sich das Urteil, wenn einer der beiden Texte vom eigenen Modell des Jurors stammt?
Bei manchen Juroren ja. Die Tabelle vergleicht für jeden Juror den Punkteanteil, den sein eigenes Modell erzielt, wenn dieser Juror entscheidet, mit dem Anteil, den dasselbe Modell unter allen anderen Juroren erzielt. Ein Sieg zählt einen Punkt, ein Unentschieden einen halben. Datenstand: alle veröffentlichten Duelle bis zum 19. September 2026, rund 63 000 Urteile je Sprache.
Sol und Opus 5 bevorzugen sich, Fable nicht
| Juror (eigenes Modell) | Englisch | Französisch | Deutsch | Spanisch |
|---|---|---|---|---|
| GPT-5.6 Sol | 87,9 % vs. 69,0 % | 90,1 % vs. 74,6 % | 93,4 % vs. 78,3 % | 92,8 % vs. 72,1 % |
| Claude Opus 5 | 94,0 % vs. 82,6 % | 99,6 % vs. 96,4 % | 98,0 % vs. 90,5 % | 96,9 % vs. 92,0 % |
| Muse Spark 1.3 | 82,6 % vs. 73,5 % | 88,2 % vs. 84,4 % | 84,1 % vs. 79,0 % | 79,3 % vs. 80,4 % |
| Claude Fable 5 | 88,1 % vs. 89,8 % | 90,7 % vs. 96,0 % | 91,3 % vs. 92,8 % | 91,0 % vs. 93,8 % |
| Claude Fable 5.1 | 84,4 % vs. 87,8 % | 90,2 % vs. 95,6 % | 90,7 % vs. 93,0 % | 90,6 % vs. 96,5 % |
Jede Zelle liest sich als „unter dem eigenen Juror vs. unter den anderen Juroren“. GPT-5.6 Sol ist der klarste Fall: Seine Texte sammeln in jeder Sprache zwischen 15 und 21 Punkte mehr, wenn Sol urteilt, über rund 1 000 selbst beurteilte Duelle je Sprache. Claude Opus 5 zeigt dieselbe Richtung mit kleinerem Abstand, 3 bis 11 Punkte. Muse Spark 1.3 neigt in drei von vier Sprachen in dieselbe Richtung, auf einer kleinen Stichprobe von 135 bis 172 Duellen.
Claude Fable 5 und Claude Fable 5.1 gehen den umgekehrten Weg. Unter ihren eigenen Urteilen erzielen ihre Texte in allen vier Sprachen 2 bis 6 Punkte weniger als unter den anderen Juroren. Was auch immer der Grund ist: Sie schmeicheln sich nicht.
Was das mit den Ranglisten macht
Jeder Juror veröffentlicht auch seine eigene Tabelle, nach Siegen sortiert. Dort setzt GPT-5.6 Sol sein Modell in allen vier Sprachen auf Platz zwei. In der Hauptrangliste, die alle Juroren zusammenführt, steht dasselbe Modell auf Platz neun in Englisch, zehn in Französisch, sechs in Deutsch und neun in Spanisch. Claude Opus 5 ist überall Erster oder Zweiter, in der eigenen Tabelle wie in der Hauptrangliste; sein Bonus ändert an der Spitze wenig, bläht aber seinen Score auf.
In der gemeinsamen Rangliste zählt der Bonus. Claude Opus 5 und GPT-5.6 Sol liefern zusammen rund 85 % aller Urteile, ihre Selbsturteile sind also keine Fußnote: Rund 800 Opus-über-Opus- und 1 000 Sol-über-Sol-Duelle je Sprache gehen zusammen mit allen anderen in die Bradley–Terry-Anpassung ein.
Warum wir noch nicht von Verzerrung sprechen
Zwei Vorbehalte machen daraus noch kein Urteil. Erstens sind die Duelle nicht dieselben. Das Modell eines Jurors trifft unter diesem Juror auf eine andere Gegnermischung als unter den anderen, und die Mischung verändert den erwartbaren Anteil. Die Abstände bei Sol sind zu groß, als dass die Gegnermischung alles erklären könnte, aber einen Teil kann sie erklären. Zweitens sind „die anderen Juroren“ kein neutrales Messinstrument: Bei Sol ist das vor allem Opus 5, bei Opus 5 vor allem Sol. Ist einer streng mit dem anderen, erscheint diese Strenge in derselben Zeile.
Der saubere Test ist eine kontrollierte Stichprobe: dieselben Paare, von jedem Juror beurteilt. Wir haben begonnen, sie aufzubauen.
Was sich auf der Website ändert
Dreierlei. Die Tabelle jedes Jurors erlaubt schon jetzt, seine Urteile getrennt zu lesen, und Sie wissen nun, welche davon mit hochgezogener Augenbraue zu lesen sind. Wir werden eine Variante der Hauptrangliste veröffentlichen, die jedes Duell ausschließt, in dem Juror und einer der Kandidaten denselben Hersteller haben, und sie mit der aktuellen vergleichen. Und wenn ein neuer Juror hinzukommt, wird seine Selbstbevorzugung gemessen, bevor seine Urteile mit den anderen zusammengeführt werden.