Lokale KI
Das laufend aktualisierte Schreibranking für Open-Weight-Modelle, mit Quantisierungsfiltern und Speicherempfehlungen.
Datenbasierte Analysen dazu, wie Modelle, Generierungseinstellungen und Bewertungsprotokolle die Textqualität beeinflussen.
Das laufend aktualisierte Schreibranking für Open-Weight-Modelle, mit Quantisierungsfiltern und Speicherempfehlungen.
Dieselbe Datei, dieselben Aufgaben, ein Schalter. Über 21 lokale Modelle bringt Reasoning der Qwen-Familie im Schnitt 33,2 Punkte und den großen Gemma-4-Modellen 6,6; die kleinen Gemma-E2B- und E4B-Builds gewinnen fast nichts und verlieren manchmal.
Manchmal nichts, manchmal 20 Punkte. Auf deutschen Aufgaben schreibt Gemma 4 31B in Q6_K so gut wie in Q8_0 bei 7 GB weniger; Qwen3.8 27B verliert in Q4_K_M 21 Punkte gegenüber Q8_0; Granite 4.2 30B verliert überall. Die Faustregel lautet: Es gibt keine Faustregel.
Aktualisiert mit 1 500 gewerteten Duellen je Build und Sprache. Der K-Quant-Dynamic-Build ist mit 77,6 Punkten das beste lokale Modell für englische Texte; auf Französisch, Deutsch und Spanisch ist der kleinere 17GB-Build die richtige Wahl.
Zwei unserer fünf Juroren geben ihrem eigenen Modell einen deutlichen Bonus: GPT-5.6 Sol bewertet seine Texte um bis zu 21 Punkte besser als die anderen Juroren, Claude Opus 5 um bis zu 11. Die beiden Fable-Juroren tun das Gegenteil und benoten sich selbst strenger.
Claude Opus 5 und GPT-5.6 Sol, die die meisten Urteile liefern, zeigen bei rund neun von zehn Modellpaaren in dieselbe Richtung. Die Unterschiede liegen woanders: Sol erklärt fast nie ein Unentschieden, Claude Fable 5.1 bis zu einmal in sechs Fällen, und Claude Opus 4.8 stimmt den anderen nur in zwei von drei Fällen zu.
91 Modelle sind in allen vier Sprachen platziert. Die Spitze bewegt sich kaum: Claude Opus 5, Claude Fable 5 und Claude Fable 5.1 stehen überall unter den ersten vier. Darunter ist GLM 5.3 Flash Zehnter in Englisch und 53. in Deutsch, Grok 4.6 25. in Englisch und 61. in Französisch.