Lokale KI

Das laufend aktualisierte Schreibranking für Open-Weight-Modelle, mit Quantisierungsfiltern und Speicherempfehlungen.

Schreibt KI auf Deutsch besser mit oder ohne Reasoning?

Dieselbe Datei, dieselben Aufgaben, ein Schalter. Über 21 lokale Modelle bringt Reasoning der Qwen-Familie im Schnitt 33,2 Punkte und den großen Gemma-4-Modellen 6,6; die kleinen Gemma-E2B- und E4B-Builds gewinnen fast nichts und verlieren manchmal.

Q4, Q6 oder Q8: Was Quantisierung mit der Schreibqualität macht

Manchmal nichts, manchmal 20 Punkte. Auf deutschen Aufgaben schreibt Gemma 4 31B in Q6_K so gut wie in Q8_0 bei 7 GB weniger; Qwen3.8 27B verliert in Q4_K_M 21 Punkte gegenüber Q8_0; Granite 4.2 30B verliert überall. Die Faustregel lautet: Es gibt keine Faustregel.

Bevorzugen KI-Juroren ihr eigenes Modell?

Zwei unserer fünf Juroren geben ihrem eigenen Modell einen deutlichen Bonus: GPT-5.6 Sol bewertet seine Texte um bis zu 21 Punkte besser als die anderen Juroren, Claude Opus 5 um bis zu 11. Die beiden Fable-Juroren tun das Gegenteil und benoten sich selbst strenger.

Wie einig sind sich die KI-Juroren?

Claude Opus 5 und GPT-5.6 Sol, die die meisten Urteile liefern, zeigen bei rund neun von zehn Modellpaaren in dieselbe Richtung. Die Unterschiede liegen woanders: Sol erklärt fast nie ein Unentschieden, Claude Fable 5.1 bis zu einmal in sechs Fällen, und Claude Opus 4.8 stimmt den anderen nur in zwei von drei Fällen zu.

Ein Modell, vier Sprachen, vier verschiedene Ränge

91 Modelle sind in allen vier Sprachen platziert. Die Spitze bewegt sich kaum: Claude Opus 5, Claude Fable 5 und Claude Fable 5.1 stehen überall unter den ersten vier. Darunter ist GLM 5.3 Flash Zehnter in Englisch und 53. in Deutsch, Grok 4.6 25. in Englisch und 61. in Französisch.