Ergebnisse der KI-Juroren
Sehen Sie die Ranglisten der einzelnen KI-Juroren und ihre unterschiedlichen Ergebnisse.
Die Modelle werden nach der Qualität ihrer deutschen Texte geordnet. Mit den Filtern lässt sich die Liste eingrenzen. Für die ausgewählten Schreibkategorien werden die Ränge vor den Filtern für Anbieter, Größe, Zugang, Reasoning und Quantisierung berechnet; ausgeblendete Modelle können daher Lücken hinterlassen.
Zuletzt aktualisiert:
| Rang | Modell | KI-Juroren-Score | Menschlicher Score |
|---|---|---|---|
| 1 | 98.2 | — | |
| 2 | 97.1 | — | |
| 4 | 96 | — | |
| 5 | 95.7 | — | |
| 6 | 93.8 | — | |
| 9 | 90.7 | — | |
| 10 | 90.2 | — | |
| 12 | 88.4 | — | |
| 13 | 87.9 | — | |
| 14 | 83.6 | — | |
| 16 | 82.9 | — | |
| 17 | 81.9 | — | |
| 18 | 81.7 | — | |
| 19 | 80.4 | — | |
| 21 | 79.8 | — | |
| 22 | 75 | — | |
| 23 | 72.6 | — | |
| 24 | 72.3 | — | |
| 26 | 71.8 | 51.5 | |
| 28 | 70.2 | 47.7 | |
| 29 | 67 | — | |
| 31 | 66.2 | — | |
| 34 | 63.7 | — | |
| 36 | 62.5 | — | |
| 40 | 60.3 | — | |
| 43 | 57.8 | — | |
| 43 | 57.8 | — | |
| 50 | 51.9 | — | |
| 51 | 50.6 | — | |
| 53 | 47.7 | — | |
| 53 | 47.7 | — | |
| 55 | 47 | 58.4 | |
| 59 | 44.5 | — | |
| 61 | 35.7 | — | |
| 65 | 28.1 | — | |
| 66 | 25.3 | — | |
| 69 | 22.8 | — | |
| 72 | 17.3 | — | |
| 74 | 15.2 | — | |
| 75 | 14.2 | — | |
| 82 | 10.3 | — | |
| 87 | 7.1 | — | |
| 89 | 4.6 | — | |
| 92 | 1.5 | — |
Ein Modell erscheint nach seiner ersten veröffentlichten Einzelbewertung; sein Ranglistenwert nach seinem ersten zulässigen Duell.
92 verglichene Modelle62605 veröffentlichte KI-Urteile
Methode: regularisiertes Bradley–Terry-Modell. Der KI-Juroren-Score bestimmt den Rang; der menschliche Score ist unabhängig und bleibt nachrangig, bis mehr Stimmen aus der Community vorliegen. Ein Score von 50 entspricht einer geschätzten Chance von eins zu zwei, das durchschnittliche Modell in dieser Sprache und Kategorie zu schlagen.
Jede Zelle zeigt den Anteil der möglichen Punkte, den das Zeilenmodell gegen das Spaltenmodell erzielt: Ein Sieg zählt 100 %, ein Unentschieden 50 %, eine Niederlage 0 %. Diese Ergebnismatrix verwendet nur die mit der Hauptrangliste kompatiblen Bewertungsprotokolle.
Gerichtete Matrix der in direkten Duellen erzielten Punkte. Werte über 50 % sprechen für das Zeilenmodell, Werte darunter für das Spaltenmodell.
0 %100 %
💡 kennzeichnet ein Modell mit Reasoning, ↯ eines ohne Reasoning. 🏠 kennzeichnet ein Modell, das lokal auf dem Rechner des Autors dieser Website.„on*“ bedeutet, dass Reasoning ein- oder ausgeschaltet ist (lokale Modelle ohne Zwischenstufen): Die angeforderte Feineinstellung wird von der lokalen Datei nicht unterstützt und fällt auf den standardmäßig aktivierten Modus zurück. Bei lokalen Modellen mit einstellbarem Reasoning (Qwen3.8, Muse Glimmer, Granite 4.2, Nemotron 3 Super, K2 Horizon, Ling 3.0 Flash) ist das angezeigte Niveau (xhigh**, high, full) das Standardniveau des Modells: Die angeforderte Feineinstellung wird von der lokalen Datei nicht unterstützt und fällt auf das Standardverhalten zurück.
| Modell |
|---|
Jede Zelle zeigt, wie viele veröffentlichte, KI-bewertete Duelle über alle Protokolle hinweg die beiden Modelle für diese Sprache und Kategorie vergleichen. Die Modelle auf beiden Achsen sind Kandidaten; die Matrix zeigt nicht, welcher Juror das jeweilige Urteil gefällt hat.
Symmetrische Matrix der veröffentlichten Duellzahlen. Die Diagonale ist null, weil ein Modell nicht mit sich selbst verglichen wird.
0
💡 kennzeichnet ein Modell mit Reasoning, ↯ eines ohne Reasoning. 🏠 kennzeichnet ein Modell, das lokal auf dem Rechner des Autors dieser Website.„on*“ bedeutet, dass Reasoning ein- oder ausgeschaltet ist (lokale Modelle ohne Zwischenstufen): Die angeforderte Feineinstellung wird von der lokalen Datei nicht unterstützt und fällt auf den standardmäßig aktivierten Modus zurück. Bei lokalen Modellen mit einstellbarem Reasoning (Qwen3.8, Muse Glimmer, Granite 4.2, Nemotron 3 Super, K2 Horizon, Ling 3.0 Flash) ist das angezeigte Niveau (xhigh**, high, full) das Standardniveau des Modells: Die angeforderte Feineinstellung wird von der lokalen Datei nicht unterstützt und fällt auf das Standardverhalten zurück.
| Modell |
|---|
Welches Modell schreibt den besseren Text? Beurteile dieses anonyme Paar und trage zur menschlichen Rangliste bei. Im Textduell siehst du nicht, welches Modell welchen Text geschrieben hat. Die Namen werden erst nach deiner Wahl angezeigt.
Sehen Sie die Ranglisten der einzelnen KI-Juroren und ihre unterschiedlichen Ergebnisse.
Vorläufige Ergebnisse aus Blindvergleichen in dieser Sprache.