Im Juli stellten wir diese Frage mit wenigen Dutzend Urteilen und antworteten vorsichtig: Antworten mit Reasoning holten die Mehrheit der Punkte, aber das Intervall schloss die Parität ein. Zwei Monate und 63 000 Urteile später ist aus der vorsichtigen Antwort eine präzise geworden. Jedes lokale Modell dieses Rankings lief zweimal über dieselben 240 deutschen Aufgaben, einmal mit aktivierter Reasoning-Phase und einmal ohne, und beide Varianten nahmen an denselben Blindduellen teil. Die Scores unten sind ihre Positionen in der deutschen Hauptrangliste, wo 50 eine Chance von eins zu zwei bedeutet, das durchschnittliche Modell zu schlagen.

Einundzwanzig Modelle, ein Schalter

Lokales Modell Mit Reasoning Ohne Differenz
Qwen3.8 27B Q8_0 67,0 28,1 +38,9
Qwen3.8 27B Q6_K 63,7 28,6 +35,1
Qwen3.6 27B Q8_0 58,5 23,5 +35,0
Qwen3.6 35B A3B Q4_K_M 47,0 13,5 +33,5
Qwen3.6 35B A3B Q8_0 47,0 17,3 +29,7
Qwen3.8 27B Q4_K_M 46,2 19,4 +26,8
Gemma 4 26B A4B QAT-Q4_0 52,5 30,5 +22,0
Gemma 4 26B A4B Q8_0 70,2 50,6 +19,6
Gemma 4 31B Q6_K 70,5 60,4 +10,1
Gemma 4 31B Q8_0 71,8 63,7 +8,1
Gemma 4 E4B Q8_0 22,8 15,2 +7,6
Gemma 4 26B A4B Q6_K 52,1 46,4 +5,7
Gemma 4 E2B Q4_K_M 10,1 5,2 +4,9
Gemma 4 12B QAT-Q4_0 52,8 48,8 +4,0
Gemma 4 31B QAT-Q4_0 64,8 61,2 +3,6
Gemma 4 E4B Q4_K_M 12,6 10,9 +1,7
Gemma 4 E2B Q8_0 10,3 14,2 -3,9
Gemma 4 12B Q6_K 53,5 58,5 -5,0
Gemma 4 12B Q8_0 51,9 60,3 -8,4
Gemma 4 E2B Q6_K 8,2 16,9 -8,7
Gemma 4 E4B Q6_K 9,0 17,8 -8,8

Qwen braucht sein Reasoning, Gemma viel weniger

Jede Qwen-Variante gewinnt mit Reasoning zwischen 26,8 und 38,9 Punkten. Qwen3.8 27B Q8_0 steigt von 28,1 auf 67,0: Ohne Reasoning eines der schwächsten Modelle der Rangliste, mit Reasoning das viertbeste lokale Modell. Die Qwen-Modelle scheinen in der Reasoning-Phase zu entwerfen und in der sichtbaren Antwort nur noch zu polieren; nimmt man den Entwurf weg, bleibt die Antwort dünn.

Die großen Gemma-4-Modelle (12B, 26B A4B, 31B) zeigen ein gemischtes Bild: von +22,0 Punkten beim 26B A4B QAT-Q4_0 bis −8,4 beim 12B Q8_0, im Schnitt 6,6. Gemma schreibt ohne Reasoning einen ordentlichen Text, und einige Dateien schreiben auf Deutsch so sogar besser. Der 31B QAT-Q4_0 bewegt sich um vier Punkte, kaum mehr als das Konfidenzintervall.

Die kleinen Gemma-4-E2B- und E4B-Builds liegen im Schnitt bei -1,2 Punkten, und 3 ihrer 6 Paare sind negativ: Bei diesen Modellen liefert die Reasoning-Phase manchmal einen schlechteren Text als gar kein Reasoning.

Was sich seit Juli geändert hat

Der Juli-Artikel hatte vier Varianten und 34 englische Urteile; er fand 66,2 % der Punkte für Reasoning bei einem Intervall von 48,6 % bis 80,6 %. Die Richtung stimmte, die Vorsicht war berechtigt. Heute ruht jedes Paar der Tabelle auf 1 000 bis 1 800 gewerteten Duellen je Variante, die Intervalle sind zwei bis drei Punkte breit, und die Spaltung zwischen den Familien ist das Ergebnis: Reasoning ist keine allgemeine Einstellung, die beim Schreiben hilft, sondern eine Eigenschaft jedes einzelnen Modells.

Dasselbe Experiment in drei anderen Sprachen

Die englische, französische und spanische Ausgabe führen dieselben 21 Paare auf ihren eigenen Aufgaben aus. Qwen gewinnt überall. Gemmas Gewinne sind kleiner, und in Deutsch wie in Französisch schreiben mehrere Gemma-Dateien ohne Reasoning besser. Die Einstellung ist je Modell und je Sprache zu testen, genau das erlaubt der Filter „Generierungsmodus“ der vier Ranglisten.