Ich heiße Johannes Eva und entwickle seit 27 Jahren Websites. Das KI-Schreibranking entstand aus einer Lücke: Keine bestehende Rangliste maß, was mich interessierte, nämlich die Schreibqualität von KI-Modellen auf Deutsch.

Öffentliche Benchmarks konzentrieren sich vor allem auf Code, Mathematik und logisches Denken. Der kleine Teil, der sich mit Schreiben beschäftigt, wird fast immer auf Englisch bewertet. Hier zählt nur die Qualität der erzeugten Texte. Die Aufgaben werden direkt auf Deutsch entwickelt, die Antworten blind verglichen.

Modelle, die auf dem eigenen Rechner laufen, haben einen besonderen Platz. Gemma 4, Qwen 3.6 und 3.8, Ling 3.0 Flash, Muse Glimmer und Granite 4.2 gehören zu den Familien, die mit 🏠 gekennzeichnet sind. Sie wurden lokal in mehreren Quantisierungen ausgeführt, mit aktiviertem und deaktiviertem Reasoning.

Diese Website ist ein persönliches Projekt. Kein Modellentwickler bezahlt mich, und ich habe keinen Grund, ein Modell zu bevorzugen.

Die Rechner für die lokalen Modelle

Framework Desktop für lokale Sprachmodelle des KI-Schreibrankings
Rechner
Framework Desktop, AMD Ryzen AI Max 300 Serie, Revision A6
Prozessor
AMD Ryzen AI Max+ 395, 16 Kerne und 32 Threads, bis zu 5,19 GHz
Grafik
Integrierte AMD Radeon 8060S
Speicher
128 GB gemeinsamer Speicher für Prozessor und Grafikeinheit

Die lokalen Modelle laufen auf einem Framework Desktop mit AMD Ryzen AI Max+ 395. Seine 128 GB gemeinsamer Speicher stehen Prozessor und Grafikeinheit zur Verfügung. So lassen sich größere Modelle laden, als es mit den meisten Grafikkarten für Privatanwender möglich wäre. Ein zweiter Rechner mit einer NVIDIA GeForce RTX 5070 Ti steuert die leichteren Modelle bei.

Beobachtete lokale Generierungsgeschwindigkeit (Strix Halo)

Median der auf der Strix-Halo-Maschine (Framework Desktop, Ryzen AI Max+ 395) erzeugten Tokens pro Sekunde über die dort generierten gültigen Benchmark-Antworten, einschließlich Reasoning-Tokens. Die Geschwindigkeit hängt von Kontextlänge und Software ab. Modelle ohne genügend Messungen auf Strix Halo sind nicht aufgeführt.

ModellQuantisierungMedianAntworten
Gemma 4 26B A4BQ8_039.8 Token/s465
Gemma 4 E2BQ4_K_M39.4 Token/s224
Gemma 4 E4BQ8_035.9 Token/s542
Gemma 4 E2BQ6_K33.2 Token/s216
Ling 3.0 FlashQ4_K_M31.6 Token/s277
Ling 3.0 FlashQ4_K_M30.5 Token/s240
Gemma 4 E2BQ8_029.2 Token/s224
Gemma 4 26B A4B QATQAT-Q4_027.9 Token/s118
Qwen3.6 35B A3BQ4_K_M26.6 Token/s347
Nemotron 3 Nano OmniQ4_K_M25.1 Token/s960
Gemma 4 E4BQ4_K_M22.4 Token/s221
Qwen3.6 35B A3BQ8_022.1 Token/s312
Nemotron 3 Nano OmniQ8_021.2 Token/s391
Nemotron 3 SuperQ4_K_M21.1 Token/s413
Gemma 4 26B A4BQ6_K20.2 Token/s539
Gemma 4 E4BQ6_K18.6 Token/s218
Granite 4.2 8BQ4_K_M16.9 Token/s36
Gemma 4 12BQ8_014.6 Token/s124
Gemma 4 12B QATQAT-Q4_011 Token/s752
Gemma 4 31B QATQAT-Q4_010 Token/s548
Gemma 4 12BQ6_K9 Token/s216
Qwen3.8 27BQ4_K_M8.9 Token/s546
Muse Glimmer 30B Kquant 17gbK-Quant 17GB8.8 Token/s394
Qwen3.8 27BQ8_08.4 Token/s498
Muse Glimmer 30B Kquant DynamicK-Quant Dynamic8 Token/s397
Granite 4.2 30BQ4_K_M7.6 Token/s423
Qwen3.6 27BQ8_07.5 Token/s190
Qwen3.8 27BQ6_K7 Token/s504
Granite 4.2 30BQ6_K6.6 Token/s397
Gemma 4 31BQ6_K5.8 Token/s527
Qwen3.6 27BQ4_K_M5.2 Token/s588
Granite 4.2 30BQ8_04.9 Token/s447
Gemma 4 31BQ8_04.8 Token/s316

Vergleichbare veröffentlichte Benchmarks für Ryzen AI Max+ 395