Die Modelle, die am besten auf Deutsch schreiben

Das KI-Schreibranking misst, wie gut führende KI-Modelle auf Deutsch schreiben. Grundlage ist ein gemeinsamer Korpus deutschsprachiger Schreibaufgaben. Die Antworten auf dieselbe Aufgabe werden ohne Modellnamen verglichen; aus den Urteilen entsteht eine eigene Rangliste für Deutsch.

An der Spitze über alle Kategorien hinweg

Die 10 besten Modelle

Die zehn besten Modelle für deutsche Texte
#ModellPunkte
1Claude Opus 5 💡 adaptive high98.2
2Claude Fable 5.1 💡 adaptive high97.1
3Claude Fable 5 💡 adaptive high96.8
4GPT-6 Astra 💡 high96
5Kimi K3 💡 enabled95.7
6GPT-5.6 Sol 💡 high93.8
7Muse Spark 1.2 💡 high92.1
8Claude Opus 4.8 💡 adaptive high90.8
9Gemini 3.8 Flash 💡 high90.7
10DeepSeek V4.1 Flash 💡 high90.2

Dieser Score ist keine Prozentnote: 50 entspricht einer geschätzten Chance von eins zu zwei, das durchschnittliche Modell auf Deutsch zu schlagen.

Zuletzt aktualisiert: Vollständige Rangliste

Die 10 besten lokalen Varianten

Der angegebene VRAM ist ein gerundeter Richtwert für den Grafikspeicher, der zum vollständigen Laden des Modells benötigt wird.

Die zehn besten lokal ausgeführten Varianten
#ModellPunkteGeschätzter VRAM
1Gemma 4 31B Q8_0 💡 on* 🏠71.8≈ 48 GB
2Gemma 4 31B Q6_K 💡 on* 🏠70.5≈ 32 GB
3Gemma 4 26B A4B Q8_0 💡 on* 🏠70.2≈ 32 GB
4Qwen3.8 27B Q8_0 💡 xhigh** 🏠67≈ 48 GB
5Muse Glimmer 30B K-Quant 17GB 💡 high 🏠65.9≈ 24 GB
6Gemma 4 31B QAT-Q4_0 💡 on* 🏠64.8≈ 24 GB
7Gemma 4 31B Q8_0 🏠63.7≈ 48 GB
8Qwen3.8 27B Q6_K 💡 xhigh** 🏠63.7≈ 32 GB
9Muse Glimmer 30B K-Quant Dynamic 💡 high 🏠61.4≈ 32 GB
10Gemma 4 31B QAT-Q4_0 🏠61.2≈ 24 GB

Je nach Software kann ein Teil des Modells im Arbeitsspeicher verbleiben. Das senkt den VRAM-Bedarf, verlangsamt die Ausführung aber in der Regel.

Lokale KI →

92verglichene Modelle
62.605veröffentlichte KI-Urteile

Die Rangliste bewertet ausschließlich die Schreibqualität. Die Aufgaben entstehen direkt in der geprüften Sprache, und die Modellnamen bleiben bis zum Urteil verborgen, damit ihr Ruf die Bewertung nicht beeinflusst. Diese Website ist ein persönliches Projekt. Kein Modellentwickler bezahlt mich, und ich habe keinen Grund, ein Modell zu bevorzugen.

Mehr erfahren

Schreibt KI auf Deutsch besser mit oder ohne Reasoning?

Dieselbe Datei, dieselben Aufgaben, ein Schalter. Über 21 lokale Modelle bringt Reasoning der Qwen-Familie im Schnitt 33,2 Punkte und den großen Gemma-4-Modellen 6,6; die kleinen Gemma-E2B- und E4B-Builds gewinnen fast nichts und verlieren manchmal.

Q4, Q6 oder Q8: Was Quantisierung mit der Schreibqualität macht

Manchmal nichts, manchmal 20 Punkte. Auf deutschen Aufgaben schreibt Gemma 4 31B in Q6_K so gut wie in Q8_0 bei 7 GB weniger; Qwen3.8 27B verliert in Q4_K_M 21 Punkte gegenüber Q8_0; Granite 4.2 30B verliert überall. Die Faustregel lautet: Es gibt keine Faustregel.

Muse Glimmer 30B im Schreibtest: Vergleich mit lokalen Konkurrenten

Aktualisiert mit 1 500 gewerteten Duellen je Build und Sprache. Der K-Quant-Dynamic-Build ist mit 77,6 Punkten das beste lokale Modell für englische Texte; auf Französisch, Deutsch und Spanisch ist der kleinere 17GB-Build die richtige Wahl.

Bevorzugen KI-Juroren ihr eigenes Modell?

Zwei unserer fünf Juroren geben ihrem eigenen Modell einen deutlichen Bonus: GPT-5.6 Sol bewertet seine Texte um bis zu 21 Punkte besser als die anderen Juroren, Claude Opus 5 um bis zu 11. Die beiden Fable-Juroren tun das Gegenteil und benoten sich selbst strenger.

Wie einig sind sich die KI-Juroren?

Claude Opus 5 und GPT-5.6 Sol, die die meisten Urteile liefern, zeigen bei rund neun von zehn Modellpaaren in dieselbe Richtung. Die Unterschiede liegen woanders: Sol erklärt fast nie ein Unentschieden, Claude Fable 5.1 bis zu einmal in sechs Fällen, und Claude Opus 4.8 stimmt den anderen nur in zwei von drei Fällen zu.

Ein Modell, vier Sprachen, vier verschiedene Ränge

91 Modelle sind in allen vier Sprachen platziert. Die Spitze bewegt sich kaum: Claude Opus 5, Claude Fable 5 und Claude Fable 5.1 stehen überall unter den ersten vier. Darunter ist GLM 5.3 Flash Zehnter in Englisch und 53. in Deutsch, Grok 4.6 25. in Englisch und 61. in Französisch.