Das KI-Schreibranking misst, wie gut führende KI-Modelle auf Deutsch schreiben. Grundlage ist ein gemeinsamer Korpus deutschsprachiger Schreibaufgaben. Die Antworten auf dieselbe Aufgabe werden ohne Modellnamen verglichen; aus den Urteilen entsteht eine eigene Rangliste für Deutsch.
An der Spitze über alle Kategorien hinweg
Die 10 besten Modelle
Die zehn besten Modelle für deutsche Texte
#
Modell
Punkte
1
Claude Opus 5 💡 adaptive high
98.2
2
Claude Fable 5.1 💡 adaptive high
97.1
3
Claude Fable 5 💡 adaptive high
96.8
4
GPT-6 Astra 💡 high
96
5
Kimi K3 💡 enabled
95.7
6
GPT-5.6 Sol 💡 high
93.8
7
Muse Spark 1.2 💡 high
92.1
8
Claude Opus 4.8 💡 adaptive high
90.8
9
Gemini 3.8 Flash 💡 high
90.7
10
DeepSeek V4.1 Flash 💡 high
90.2
Dieser Score ist keine Prozentnote: 50 entspricht einer geschätzten Chance von eins zu zwei, das durchschnittliche Modell auf Deutsch zu schlagen.
Die Rangliste bewertet ausschließlich die Schreibqualität. Die Aufgaben entstehen direkt in der geprüften Sprache, und die Modellnamen bleiben bis zum Urteil verborgen, damit ihr Ruf die Bewertung nicht beeinflusst. Diese Website ist ein persönliches Projekt. Kein Modellentwickler bezahlt mich, und ich habe keinen Grund, ein Modell zu bevorzugen.
Dieselbe Datei, dieselben Aufgaben, ein Schalter. Über 21 lokale Modelle bringt Reasoning der Qwen-Familie im Schnitt 33,2 Punkte und den großen Gemma-4-Modellen 6,6; die kleinen Gemma-E2B- und E4B-Builds gewinnen fast nichts und verlieren manchmal.
Manchmal nichts, manchmal 20 Punkte. Auf deutschen Aufgaben schreibt Gemma 4 31B in Q6_K so gut wie in Q8_0 bei 7 GB weniger; Qwen3.8 27B verliert in Q4_K_M 21 Punkte gegenüber Q8_0; Granite 4.2 30B verliert überall. Die Faustregel lautet: Es gibt keine Faustregel.
Aktualisiert mit 1 500 gewerteten Duellen je Build und Sprache. Der K-Quant-Dynamic-Build ist mit 77,6 Punkten das beste lokale Modell für englische Texte; auf Französisch, Deutsch und Spanisch ist der kleinere 17GB-Build die richtige Wahl.
Zwei unserer fünf Juroren geben ihrem eigenen Modell einen deutlichen Bonus: GPT-5.6 Sol bewertet seine Texte um bis zu 21 Punkte besser als die anderen Juroren, Claude Opus 5 um bis zu 11. Die beiden Fable-Juroren tun das Gegenteil und benoten sich selbst strenger.
Claude Opus 5 und GPT-5.6 Sol, die die meisten Urteile liefern, zeigen bei rund neun von zehn Modellpaaren in dieselbe Richtung. Die Unterschiede liegen woanders: Sol erklärt fast nie ein Unentschieden, Claude Fable 5.1 bis zu einmal in sechs Fällen, und Claude Opus 4.8 stimmt den anderen nur in zwei von drei Fällen zu.
91 Modelle sind in allen vier Sprachen platziert. Die Spitze bewegt sich kaum: Claude Opus 5, Claude Fable 5 und Claude Fable 5.1 stehen überall unter den ersten vier. Darunter ist GLM 5.3 Flash Zehnter in Englisch und 53. in Deutsch, Grok 4.6 25. in Englisch und 61. in Französisch.