Q4, Q6 oder Q8: Was Quantisierung mit der Schreibqualität macht
Manchmal nichts, manchmal 20 Punkte. Auf deutschen Aufgaben schreibt Gemma 4 31B in Q6_K so gut wie in Q8_0 bei 7 GB weniger; Qwen3.8 27B verliert in Q4_K_M 21 Punkte gegenüber Q8_0; Granite 4.2 30B verliert überall. Die Faustregel lautet: Es gibt keine Faustregel.
Quantisierung verkleinert ein Modell, indem sie die Gewichte mit weniger Bits speichert. Ein Modell mit 27 Milliarden Parametern hat in Q8_0 27 GB und in Q4_K_M 16 GB, das ist der Unterschied zwischen Passen und Nichtpassen auf eine 32-GB-Grafikkarte. Jeder Ratgeber sagt, die kleinere Datei schreibe etwas schlechter. Wir haben gemessen, wie viel, auf Deutsch, mit denselben Blindduellen, aus denen die Hauptrangliste entsteht. Die Scores sind die der deutschen Rangliste: 50 bedeutet eine Chance von eins zu zwei, das durchschnittliche Modell zu schlagen. Größen sind die GGUF-Dateien; Geschwindigkeiten sind Mediane auf unserer Strix-Halo-Maschine, Reasoning-Tokens eingeschlossen.
Dasselbe Modell, drei Dateien, drei Scores
| Familie | Quantisierung | Score | Datei (GB) | Tempo (Tok/s) | Duelle |
|---|---|---|---|---|---|
| Qwen3.8 27B | Q8_0 | 67,0 | 27,1 | 8,4 | 1155 |
| Q6_K | 63,7 | 20,9 | 7,0 | 1163 | |
| Q4_K_M | 46,2 | 15,7 | 8,9 | 1011 | |
| Qwen3.6 27B | Q8_0 | 58,5 | 26,6 | 7,5 | 1021 |
| Q4_K_M | 42,1 | 15,4 | 5,2 | 1143 | |
| Qwen3.6 35B A3B | Q4_K_M | 47,0 | 19,7 | 26,6 | 1668 |
| Q8_0 | 47,0 | 34,4 | 22,1 | 1564 | |
| Gemma 4 31B | Q8_0 | 71,8 | 30,4 | 4,8 | 1800 |
| Q6_K | 70,5 | 23,5 | 5,8 | 1164 | |
| QAT-Q4_0 | 64,8 | 16,4 | 10,0 | 1807 | |
| Gemma 4 26B A4B | Q8_0 | 70,2 | 25,0 | 39,8 | 1745 |
| QAT-Q4_0 | 52,5 | 13,4 | 27,9 | 1736 | |
| Q6_K | 52,1 | 21,1 | 20,2 | 987 | |
| Gemma 4 12B | Q6_K | 53,5 | 9,1 | 9,0 | 1333 |
| QAT-Q4_0 | 52,8 | 6,5 | 11,0 | 1625 | |
| Q8_0 | 51,9 | 11,8 | 14,6 | 1743 | |
| Muse Glimmer 30B | K-Quant 17GB (≈ Q4) | 65,9 | 15,6 | 8,8 | 1537 |
| K-Quant Dynamic (≈ Q5) | 61,4 | 18,3 | 8,0 | 1545 | |
| Granite 4.2 30B | Q4_K_M | 10,8 | 16,5 | 7,6 | 1028 |
| Q6_K | 10,1 | 22,4 | 6,6 | 945 | |
| Q8_0 | 7,1 | 29,0 | 4,9 | 1037 | |
| Nemotron 3 Nano Omni 30B A3B | Q4_K_M | 12,0 | 22,8 | 25,1 | 1447 |
| Q8_0 | 4,6 | 31,3 | 21,2 | 1019 |
Wo Quantisierung nichts kostet
Gemma 4 31B ist das gutmütige Modell: Q8_0 und Q6_K liegen einen Punkt auseinander, auf über 1 100 Duellen je Datei, und beide sind die besten lokalen Modelle der deutschen Rangliste. Sogar der QAT-Q4_0-Build mit 16 GB bleibt in Reichweite. Gemma 4 12B ist praktisch gleichgültig: QAT-Q4_0, Q6_K und Q8_0 liegen innerhalb von zwei Punkten. Qwen3.6 35B A3B verliert in Q4 nichts.
Wo sie teuer ist
Qwen3.8 27B ist das Gegenbeispiel: Q8_0 erreicht 67, Q6_K 64, Q4_K_M nur 46. Dieselbe Datei, die in Französisch das beste lokale Modell ist, verliert in Deutsch 21 Punkte. Qwen3.6 27B verliert in Q4 sechzehn Punkte, Gemma 4 26B A4B achtzehn. Nemotron 3 Nano und Granite 4.2 30B schneiden in jeder Quantisierung so schlecht ab, dass der Unterschied kaum noch zählt. Muse Glimmer 30B bevorzugt wie in Französisch die kleinere Datei: 17GB liegt vier Punkte vor K-Quant Dynamic.
Q6 ist selten die Antwort
Über neun Familien ist Q6_K nur bei Gemma 4 12B knapp die beste Wahl und oft die schlechteste. Es spart weniger Speicher als Q4 und behält selten die Qualität von Q8. Wer blind wählen muss, nimmt Q8, wenn es passt, einen QAT- oder K-Quant-Q4-Build, wenn nicht, und lässt Q6 aus.
Dieselbe Tabelle in einer anderen Sprache sagt etwas anderes
Dies ist die deutsche Ausgabe. Die englische, französische und spanische Ausgabe dieses Artikels verwenden dieselben Dateien und kommen zu anderen Urteilen: In Englisch ist Qwen3.8 27B in Q4_K_M sogar besser als in Q8_0. Eine Quantisierung ist nicht an sich gut oder schlecht; sie ist gut oder schlecht für ein Modell in einer Sprache, und deshalb messen wir sie je Ausgabe.