Quantisierung verkleinert ein Modell, indem sie die Gewichte mit weniger Bits speichert. Ein Modell mit 27 Milliarden Parametern hat in Q8_0 27 GB und in Q4_K_M 16 GB, das ist der Unterschied zwischen Passen und Nichtpassen auf eine 32-GB-Grafikkarte. Jeder Ratgeber sagt, die kleinere Datei schreibe etwas schlechter. Wir haben gemessen, wie viel, auf Deutsch, mit denselben Blindduellen, aus denen die Hauptrangliste entsteht. Die Scores sind die der deutschen Rangliste: 50 bedeutet eine Chance von eins zu zwei, das durchschnittliche Modell zu schlagen. Größen sind die GGUF-Dateien; Geschwindigkeiten sind Mediane auf unserer Strix-Halo-Maschine, Reasoning-Tokens eingeschlossen.

Dasselbe Modell, drei Dateien, drei Scores

Familie Quantisierung Score Datei (GB) Tempo (Tok/s) Duelle
Qwen3.8 27B Q8_0 67,0 27,1 8,4 1155
Q6_K 63,7 20,9 7,0 1163
Q4_K_M 46,2 15,7 8,9 1011
Qwen3.6 27B Q8_0 58,5 26,6 7,5 1021
Q4_K_M 42,1 15,4 5,2 1143
Qwen3.6 35B A3B Q4_K_M 47,0 19,7 26,6 1668
Q8_0 47,0 34,4 22,1 1564
Gemma 4 31B Q8_0 71,8 30,4 4,8 1800
Q6_K 70,5 23,5 5,8 1164
QAT-Q4_0 64,8 16,4 10,0 1807
Gemma 4 26B A4B Q8_0 70,2 25,0 39,8 1745
QAT-Q4_0 52,5 13,4 27,9 1736
Q6_K 52,1 21,1 20,2 987
Gemma 4 12B Q6_K 53,5 9,1 9,0 1333
QAT-Q4_0 52,8 6,5 11,0 1625
Q8_0 51,9 11,8 14,6 1743
Muse Glimmer 30B K-Quant 17GB (≈ Q4) 65,9 15,6 8,8 1537
K-Quant Dynamic (≈ Q5) 61,4 18,3 8,0 1545
Granite 4.2 30B Q4_K_M 10,8 16,5 7,6 1028
Q6_K 10,1 22,4 6,6 945
Q8_0 7,1 29,0 4,9 1037
Nemotron 3 Nano Omni 30B A3B Q4_K_M 12,0 22,8 25,1 1447
Q8_0 4,6 31,3 21,2 1019

Wo Quantisierung nichts kostet

Gemma 4 31B ist das gutmütige Modell: Q8_0 und Q6_K liegen einen Punkt auseinander, auf über 1 100 Duellen je Datei, und beide sind die besten lokalen Modelle der deutschen Rangliste. Sogar der QAT-Q4_0-Build mit 16 GB bleibt in Reichweite. Gemma 4 12B ist praktisch gleichgültig: QAT-Q4_0, Q6_K und Q8_0 liegen innerhalb von zwei Punkten. Qwen3.6 35B A3B verliert in Q4 nichts.

Wo sie teuer ist

Qwen3.8 27B ist das Gegenbeispiel: Q8_0 erreicht 67, Q6_K 64, Q4_K_M nur 46. Dieselbe Datei, die in Französisch das beste lokale Modell ist, verliert in Deutsch 21 Punkte. Qwen3.6 27B verliert in Q4 sechzehn Punkte, Gemma 4 26B A4B achtzehn. Nemotron 3 Nano und Granite 4.2 30B schneiden in jeder Quantisierung so schlecht ab, dass der Unterschied kaum noch zählt. Muse Glimmer 30B bevorzugt wie in Französisch die kleinere Datei: 17GB liegt vier Punkte vor K-Quant Dynamic.

Q6 ist selten die Antwort

Über neun Familien ist Q6_K nur bei Gemma 4 12B knapp die beste Wahl und oft die schlechteste. Es spart weniger Speicher als Q4 und behält selten die Qualität von Q8. Wer blind wählen muss, nimmt Q8, wenn es passt, einen QAT- oder K-Quant-Q4-Build, wenn nicht, und lässt Q6 aus.

Dieselbe Tabelle in einer anderen Sprache sagt etwas anderes

Dies ist die deutsche Ausgabe. Die englische, französische und spanische Ausgabe dieses Artikels verwenden dieselben Dateien und kommen zu anderen Urteilen: In Englisch ist Qwen3.8 27B in Q4_K_M sogar besser als in Q8_0. Eine Quantisierung ist nicht an sich gut oder schlecht; sie ist gut oder schlecht für ein Modell in einer Sprache, und deshalb messen wir sie je Ausgabe.