Schreibt KI auf Deutsch besser mit oder ohne Reasoning?
Dieselbe Datei, dieselben Aufgaben, ein Schalter. Über 21 lokale Modelle bringt Reasoning der Qwen-Familie im Schnitt 33,2 Punkte und den großen Gemma-4-Modellen 6,6; die kleinen Gemma-E2B- und E4B-Builds gewinnen fast nichts und verlieren manchmal.
Im Juli stellten wir diese Frage mit wenigen Dutzend Urteilen und antworteten vorsichtig: Antworten mit Reasoning holten die Mehrheit der Punkte, aber das Intervall schloss die Parität ein. Zwei Monate und 63 000 Urteile später ist aus der vorsichtigen Antwort eine präzise geworden. Jedes lokale Modell dieses Rankings lief zweimal über dieselben 240 deutschen Aufgaben, einmal mit aktivierter Reasoning-Phase und einmal ohne, und beide Varianten nahmen an denselben Blindduellen teil. Die Scores unten sind ihre Positionen in der deutschen Hauptrangliste, wo 50 eine Chance von eins zu zwei bedeutet, das durchschnittliche Modell zu schlagen.
Einundzwanzig Modelle, ein Schalter
| Lokales Modell | Mit Reasoning | Ohne | Differenz |
|---|---|---|---|
| Qwen3.8 27B Q8_0 | 67,0 | 28,1 | +38,9 |
| Qwen3.8 27B Q6_K | 63,7 | 28,6 | +35,1 |
| Qwen3.6 27B Q8_0 | 58,5 | 23,5 | +35,0 |
| Qwen3.6 35B A3B Q4_K_M | 47,0 | 13,5 | +33,5 |
| Qwen3.6 35B A3B Q8_0 | 47,0 | 17,3 | +29,7 |
| Qwen3.8 27B Q4_K_M | 46,2 | 19,4 | +26,8 |
| Gemma 4 26B A4B QAT-Q4_0 | 52,5 | 30,5 | +22,0 |
| Gemma 4 26B A4B Q8_0 | 70,2 | 50,6 | +19,6 |
| Gemma 4 31B Q6_K | 70,5 | 60,4 | +10,1 |
| Gemma 4 31B Q8_0 | 71,8 | 63,7 | +8,1 |
| Gemma 4 E4B Q8_0 | 22,8 | 15,2 | +7,6 |
| Gemma 4 26B A4B Q6_K | 52,1 | 46,4 | +5,7 |
| Gemma 4 E2B Q4_K_M | 10,1 | 5,2 | +4,9 |
| Gemma 4 12B QAT-Q4_0 | 52,8 | 48,8 | +4,0 |
| Gemma 4 31B QAT-Q4_0 | 64,8 | 61,2 | +3,6 |
| Gemma 4 E4B Q4_K_M | 12,6 | 10,9 | +1,7 |
| Gemma 4 E2B Q8_0 | 10,3 | 14,2 | -3,9 |
| Gemma 4 12B Q6_K | 53,5 | 58,5 | -5,0 |
| Gemma 4 12B Q8_0 | 51,9 | 60,3 | -8,4 |
| Gemma 4 E2B Q6_K | 8,2 | 16,9 | -8,7 |
| Gemma 4 E4B Q6_K | 9,0 | 17,8 | -8,8 |
Qwen braucht sein Reasoning, Gemma viel weniger
Jede Qwen-Variante gewinnt mit Reasoning zwischen 26,8 und 38,9 Punkten. Qwen3.8 27B Q8_0 steigt von 28,1 auf 67,0: Ohne Reasoning eines der schwächsten Modelle der Rangliste, mit Reasoning das viertbeste lokale Modell. Die Qwen-Modelle scheinen in der Reasoning-Phase zu entwerfen und in der sichtbaren Antwort nur noch zu polieren; nimmt man den Entwurf weg, bleibt die Antwort dünn.
Die großen Gemma-4-Modelle (12B, 26B A4B, 31B) zeigen ein gemischtes Bild: von +22,0 Punkten beim 26B A4B QAT-Q4_0 bis −8,4 beim 12B Q8_0, im Schnitt 6,6. Gemma schreibt ohne Reasoning einen ordentlichen Text, und einige Dateien schreiben auf Deutsch so sogar besser. Der 31B QAT-Q4_0 bewegt sich um vier Punkte, kaum mehr als das Konfidenzintervall.
Die kleinen Gemma-4-E2B- und E4B-Builds liegen im Schnitt bei -1,2 Punkten, und 3 ihrer 6 Paare sind negativ: Bei diesen Modellen liefert die Reasoning-Phase manchmal einen schlechteren Text als gar kein Reasoning.
Was sich seit Juli geändert hat
Der Juli-Artikel hatte vier Varianten und 34 englische Urteile; er fand 66,2 % der Punkte für Reasoning bei einem Intervall von 48,6 % bis 80,6 %. Die Richtung stimmte, die Vorsicht war berechtigt. Heute ruht jedes Paar der Tabelle auf 1 000 bis 1 800 gewerteten Duellen je Variante, die Intervalle sind zwei bis drei Punkte breit, und die Spaltung zwischen den Familien ist das Ergebnis: Reasoning ist keine allgemeine Einstellung, die beim Schreiben hilft, sondern eine Eigenschaft jedes einzelnen Modells.
Dasselbe Experiment in drei anderen Sprachen
Die englische, französische und spanische Ausgabe führen dieselben 21 Paare auf ihren eigenen Aufgaben aus. Qwen gewinnt überall. Gemmas Gewinne sind kleiner, und in Deutsch wie in Französisch schreiben mehrere Gemma-Dateien ohne Reasoning besser. Die Einstellung ist je Modell und je Sprache zu testen, genau das erlaubt der Filter „Generierungsmodus“ der vier Ranglisten.