Zuletzt aktualisiert:

Rangliste der Schreibmodelle auf Basis paarweiser Ergebnisse
RangModellKI-Juroren-ScoreMenschlicher Score
1Claude Opus 5 💡 adaptive high98.2
2Claude Fable 5.1 💡 adaptive high97.1
4GPT-6 Astra 💡 high96
5Kimi K3 💡 enabled95.7
6GPT-5.6 Sol 💡 high93.8
9Gemini 3.8 Flash 💡 high90.7
10DeepSeek V4.1 Flash 💡 high90.2
12Muse Spark 1.3 💡 high88.4
13GLM 5.3 💡 max87.9
14Claude Sonnet 5 💡 adaptive high83.6
16Qwen3.8 Max 💡 xhigh82.9
17GPT-5.6 Luna 💡 high81.9
18Hy4 Preview 💡 high81.7
19GPT-5.6 Terra 💡 high80.4
21Inkling 💡 high79.8
22MiniMax M3 💡 enabled75
23Aion 3.0 💡 mandatory72.6
24Hy3 💡 high72.3
26Gemma 4 31B Q8_0 💡 on* 🏠71.851.5
28Gemma 4 26B A4B Q8_0 💡 on* 🏠70.247.7
29Qwen3.8 27B Q8_0 💡 xhigh** 🏠67
31Qwen3.7 Plus 💡 enabled66.2
34Gemma 4 31B Q8_0 🏠63.7
36MiMo V2.5 Pro 💡 enabled62.5
40Gemma 4 12B Q8_0 🏠60.3
43DeepSeek V4 Pro 💡 enabled57.8
43Qwen3.8 Flash 💡 high57.8
50Gemma 4 12B Q8_0 💡 on* 🏠51.9
51Gemma 4 26B A4B Q8_0 🏠50.6
53GLM 5.3 Flash 💡 high47.7
53Grok 4.6 💡 high47.7
55Qwen3.6 35B A3B Q8_0 💡 on* 🏠4758.4
59Mistral Medium 3.5 💡 high44.5
61Seed 2.1 Turbo35.7
65Qwen3.8 27B Q8_0 🏠28.1
66MiMo V2.5 💡 enabled25.3
69Gemma 4 E4B Q8_0 💡 on* 🏠22.8
72Qwen3.6 35B A3B Q8_0 🏠17.3
74Gemma 4 E4B Q8_0 🏠15.2
75Gemma 4 E2B Q8_0 🏠14.2
82Gemma 4 E2B Q8_0 💡 on* 🏠10.3
87Granite 4.2 30B Q8_0 💡 full 🏠7.1
89Nemotron 3 Nano Omni 30B A3B Q8_0 💡 on* 🏠4.6
92Granite 4.2 8B Q8_0 💡 full 🏠1.5

92 verglichene Modelle62605 veröffentlichte KI-Urteile

Methode: regularisiertes Bradley–Terry-Modell. Der KI-Juroren-Score bestimmt den Rang; der menschliche Score ist unabhängig und bleibt nachrangig, bis mehr Stimmen aus der Community vorliegen. Ein Score von 50 entspricht einer geschätzten Chance von eins zu zwei, das durchschnittliche Modell in dieser Sprache und Kategorie zu schlagen.

Ergebnisse der direkten Duelle

Jede Zelle zeigt den Anteil der möglichen Punkte, den das Zeilenmodell gegen das Spaltenmodell erzielt: Ein Sieg zählt 100 %, ein Unentschieden 50 %, eine Niederlage 0 %. Diese Ergebnismatrix verwendet nur die mit der Hauptrangliste kompatiblen Bewertungsprotokolle.

Gerichtete Matrix der in direkten Duellen erzielten Punkte. Werte über 50 % sprechen für das Zeilenmodell, Werte darunter für das Spaltenmodell.

0 %100 %

💡 kennzeichnet ein Modell mit Reasoning, ↯ eines ohne Reasoning. 🏠 kennzeichnet ein Modell, das lokal auf dem Rechner des Autors dieser Website.„on*“ bedeutet, dass Reasoning ein- oder ausgeschaltet ist (lokale Modelle ohne Zwischenstufen): Die angeforderte Feineinstellung wird von der lokalen Datei nicht unterstützt und fällt auf den standardmäßig aktivierten Modus zurück. Bei lokalen Modellen mit einstellbarem Reasoning (Qwen3.8, Muse Glimmer, Granite 4.2, Nemotron 3 Super, K2 Horizon, Ling 3.0 Flash) ist das angezeigte Niveau (xhigh**, high, full) das Standardniveau des Modells: Die angeforderte Feineinstellung wird von der lokalen Datei nicht unterstützt und fällt auf das Standardverhalten zurück.

Als Tabelle anzeigen
In direkten Duellen erzielte Punkte je Modellpaar
Modell

Abdeckung der veröffentlichten Duelle

Jede Zelle zeigt, wie viele veröffentlichte, KI-bewertete Duelle über alle Protokolle hinweg die beiden Modelle für diese Sprache und Kategorie vergleichen. Die Modelle auf beiden Achsen sind Kandidaten; die Matrix zeigt nicht, welcher Juror das jeweilige Urteil gefällt hat.

Symmetrische Matrix der veröffentlichten Duellzahlen. Die Diagonale ist null, weil ein Modell nicht mit sich selbst verglichen wird.

0

💡 kennzeichnet ein Modell mit Reasoning, ↯ eines ohne Reasoning. 🏠 kennzeichnet ein Modell, das lokal auf dem Rechner des Autors dieser Website.„on*“ bedeutet, dass Reasoning ein- oder ausgeschaltet ist (lokale Modelle ohne Zwischenstufen): Die angeforderte Feineinstellung wird von der lokalen Datei nicht unterstützt und fällt auf den standardmäßig aktivierten Modus zurück. Bei lokalen Modellen mit einstellbarem Reasoning (Qwen3.8, Muse Glimmer, Granite 4.2, Nemotron 3 Super, K2 Horizon, Ling 3.0 Flash) ist das angezeigte Niveau (xhigh**, high, full) das Standardniveau des Modells: Die angeforderte Feineinstellung wird von der lokalen Datei nicht unterstützt und fällt auf das Standardverhalten zurück.

Als Tabelle anzeigen
Veröffentlichte Duelle je Modellpaar
Modell

Hilf mit, das beste Schreibmodell für Deutsch zu küren

Welches Modell schreibt den besseren Text? Beurteile dieses anonyme Paar und trage zur menschlichen Rangliste bei. Im Textduell siehst du nicht, welches Modell welchen Text geschrieben hat. Die Namen werden erst nach deiner Wahl angezeigt.

Textduell