Rangliste lokaler KI-Modelle

Punktzahlen aus der deutschen Gesamtrangliste. Die Ränge werden vor den Anzeigefiltern über alle zulässigen lokalen Varianten hinweg neu vergeben; ausgeblendete Varianten können daher Lücken in der Rangfolge hinterlassen.

Zuletzt aktualisiert:

Rangliste lokaler Modelle nach Schreibqualität
RangModellBewertung KIDatei+128K+256K
1Gemma 4 31B Q8_0 💡 on* 🏠71.830.4 GB78.4 GB126.4 GB
3Gemma 4 26B A4B Q8_0 💡 on* 🏠70.225 GB55 GB85 GB
4Qwen3.8 27B Q8_0 💡 xhigh** 🏠6727.1 GB59.1 GB91.1 GB
5Muse Glimmer 30B K-Quant 17GB 💡 high 🏠65.915.6 GB22.1 GB22.1 GB
6Gemma 4 31B QAT-Q4_0 💡 on* 🏠64.816.4 GB64.4 GB112.4 GB
7Gemma 4 31B Q8_0 🏠63.730.4 GB78.4 GB126.4 GB
9Muse Glimmer 30B K-Quant Dynamic 💡 high 🏠61.418.3 GB24.8 GB24.8 GB
10Gemma 4 31B QAT-Q4_0 🏠61.216.4 GB64.4 GB112.4 GB
12Gemma 4 12B Q8_0 🏠60.311.8 GB35.8 GB59.8 GB
16Gemma 4 12B QAT-Q4_0 💡 on* 🏠52.86.5 GB30.5 GB54.5 GB
17Gemma 4 26B A4B QAT-Q4_0 💡 on* 🏠52.513.4 GB43.4 GB73.4 GB
19Gemma 4 12B Q8_0 💡 on* 🏠51.911.8 GB35.8 GB59.8 GB
20Gemma 4 26B A4B Q8_0 🏠50.625 GB55 GB85 GB
21Gemma 4 12B QAT-Q4_0 🏠48.86.5 GB30.5 GB54.5 GB
22Qwen3.6 35B A3B Q4_K_M 💡 on* 🏠4719.7 GB35.7 GB51.7 GB
23Qwen3.6 35B A3B Q8_0 💡 on* 🏠4734.4 GB50.4 GB66.4 GB
25Qwen3.8 27B Q4_K_M 💡 xhigh** 🏠46.215.7 GB47.7 GB79.7 GB
27Nemotron 3 Super 120B A12B Q4_K_M 💡 full 🏠33.580.1 GB81.1 GB82.1 GB
28Gemma 4 26B A4B QAT-Q4_0 🏠30.513.4 GB43.4 GB73.4 GB
30Qwen3.8 27B Q8_0 🏠28.127.1 GB59.1 GB91.1 GB
31Ling 3.0 Flash Q4_K_M 🏠23.871.7 GB155.7 GB239.7 GB
33Gemma 4 E4B Q8_0 💡 on* 🏠22.87.5 GB18 GB18 GB
34Qwen3.8 27B Q4_K_M 🏠19.415.7 GB47.7 GB79.7 GB
36Qwen3.6 35B A3B Q8_0 🏠17.334.4 GB50.4 GB66.4 GB
38Gemma 4 E4B Q8_0 🏠15.27.5 GB18 GB18 GB
39Gemma 4 E2B Q8_0 🏠14.24.6 GB13.6 GB13.6 GB
40Ling 3.0 Flash Q4_K_M 💡 high 🏠1471.7 GB155.7 GB239.7 GB
41Qwen3.6 35B A3B Q4_K_M 🏠13.519.7 GB35.7 GB51.7 GB
42Gemma 4 E4B Q4_K_M 💡 on* 🏠12.65 GB15.5 GB15.5 GB
43Nemotron 3 Nano Omni 30B A3B Q4_K_M 💡 on* 🏠1222.8 GB23.6 GB24.3 GB
44Gemma 4 E4B Q4_K_M 🏠10.95 GB15.5 GB15.5 GB
45Granite 4.2 30B Q4_K_M 💡 full 🏠10.816.5 GB48.5 GB48.5 GB
46Gemma 4 E2B Q8_0 💡 on* 🏠10.34.6 GB13.6 GB13.6 GB
47Gemma 4 E2B Q4_K_M 💡 on* 🏠10.13.2 GB12.2 GB12.2 GB
51Granite 4.2 30B Q8_0 💡 full 🏠7.129 GB61 GB61 GB
52Gemma 4 E2B Q4_K_M 🏠5.23.2 GB12.2 GB12.2 GB
53Nemotron 3 Nano Omni 30B A3B Q8_0 💡 on* 🏠4.631.3 GB32 GB32.8 GB
54Granite 4.2 8B Q4_K_M 💡 full 🏠35 GB25 GB25 GB
55Laguna S 2.1 UD Q4_K_M 💡 on* 🏠268.1 GB92.1 GB116.1 GB
56Granite 4.2 8B Q8_0 💡 full 🏠1.58.7 GB28.7 GB28.7 GB

Dieser Score verwendet die Skala der Gesamtrangliste und ist keine Prozentnote: Für die aktive Kategorieauswahl entspricht 50 einer geschätzten Chance von eins zu zwei, das durchschnittliche Modell für deutsche Texte zu schlagen.

56 lokale Varianten in der Rangliste62605 veröffentlichte KI-Urteile in der Gesamtrangliste

Ergebnisse der direkten Duelle

Jede Zelle zeigt den Anteil der möglichen Punkte, den das Zeilenmodell gegen das Spaltenmodell erzielt: Ein Sieg zählt 100 %, ein Unentschieden 50 %, eine Niederlage 0 %. Diese Ergebnismatrix verwendet nur die mit der Hauptrangliste kompatiblen Bewertungsprotokolle.

Gerichtete Matrix der in direkten Duellen erzielten Punkte. Werte über 50 % sprechen für das Zeilenmodell, Werte darunter für das Spaltenmodell.

0 %100 %

💡 kennzeichnet ein Modell mit Reasoning, ↯ eines ohne Reasoning. 🏠 kennzeichnet ein Modell, das lokal auf dem Rechner des Autors dieser Website.„on*“ bedeutet, dass Reasoning ein- oder ausgeschaltet ist (lokale Modelle ohne Zwischenstufen): Die angeforderte Feineinstellung wird von der lokalen Datei nicht unterstützt und fällt auf den standardmäßig aktivierten Modus zurück. Bei lokalen Modellen mit einstellbarem Reasoning (Qwen3.8, Muse Glimmer, Granite 4.2, Nemotron 3 Super, K2 Horizon, Ling 3.0 Flash) ist das angezeigte Niveau (xhigh**, high, full) das Standardniveau des Modells: Die angeforderte Feineinstellung wird von der lokalen Datei nicht unterstützt und fällt auf das Standardverhalten zurück.

Als Tabelle anzeigen
In direkten Duellen erzielte Punkte je Modellpaar
Modell

Abdeckung der veröffentlichten Duelle

Jede Zelle zeigt, wie viele veröffentlichte, KI-bewertete Duelle über alle Protokolle hinweg die beiden Modelle für diese Sprache und Kategorie vergleichen. Die Modelle auf beiden Achsen sind Kandidaten; die Matrix zeigt nicht, welcher Juror das jeweilige Urteil gefällt hat.

Symmetrische Matrix der veröffentlichten Duellzahlen. Die Diagonale ist null, weil ein Modell nicht mit sich selbst verglichen wird.

0

💡 kennzeichnet ein Modell mit Reasoning, ↯ eines ohne Reasoning. 🏠 kennzeichnet ein Modell, das lokal auf dem Rechner des Autors dieser Website.„on*“ bedeutet, dass Reasoning ein- oder ausgeschaltet ist (lokale Modelle ohne Zwischenstufen): Die angeforderte Feineinstellung wird von der lokalen Datei nicht unterstützt und fällt auf den standardmäßig aktivierten Modus zurück. Bei lokalen Modellen mit einstellbarem Reasoning (Qwen3.8, Muse Glimmer, Granite 4.2, Nemotron 3 Super, K2 Horizon, Ling 3.0 Flash) ist das angezeigte Niveau (xhigh**, high, full) das Standardniveau des Modells: Die angeforderte Feineinstellung wird von der lokalen Datei nicht unterstützt und fällt auf das Standardverhalten zurück.

Als Tabelle anzeigen
Veröffentlichte Duelle je Modellpaar
Modell

Welche lokale KI schreibt am besten?

Was ein LLM ist, und was „lokal“ daran ändert

LLM steht für Large Language Model, ein großes Sprachmodell. Vereinfacht gesagt ist das eine sehr umfangreiche Datei aus Zahlen – den sogenannten Gewichten – plus ein Programm, das diese Datei benutzt, um zu einem Text jeweils die nächste plausible Fortsetzung zu berechnen. Aus dieser Mechanik entstehen Antworten, Aufsätze, Übersetzungen, Dialoge.

Bei Cloud-Diensten liegt diese Datei auf fremden Servern. Bei lokalen LLMs laden Sie sie herunter und führen sie selbst aus. Wenn auch Laufzeit und Integrationen lokal bleiben, müssen Ihre Texte den Rechner nicht verlassen. Das Modell funktioniert ohne Internetverbindung, es ändert sich nicht über Nacht durch ein Update des Anbieters, und Sie behalten die Kontrolle über Systemprompt, Kontextlänge und Einstellungen. Für Manuskripte, Mandantenunterlagen, unveröffentlichte Recherchen oder personenbezogene Daten ist das oft der entscheidende Punkt.

Datenschutz ist allerdings ein Argument für lokale Ausführung, kein Argument für die Schreibqualität eines bestimmten Modells. Beides bewerten wir getrennt.

Offene Gewichte sind nicht dasselbe wie Open Source

Für dieses Ranking zählt ein technisches Kriterium: offene Gewichte (open-weight). Die Modelldatei ist herunterladbar und lokal ausführbar. Ob die Lizenz im Sinne der Open-Source-Definition frei ist, ob Trainingsdaten und Trainingscode offenliegen, ist eine andere – und für Unternehmen durchaus relevante – Frage. Viele populäre Modelle sind open-weight, aber nicht Open Source; manche Lizenzen schränken kommerzielle Nutzung ein. Prüfen Sie die Lizenz für Ihren Anwendungsfall selbst. Sie sagt nichts über die Qualität der deutschen Texte aus, und wir behandeln sie hier auch nicht als Qualitätsmerkmal.

Quantisierung: was sie ist, was sie bringt, was sie kostet

Die Gewichte eines Modells sind ursprünglich in relativ hoher Zahlenpräzision gespeichert, üblicherweise 16 Bit pro Wert. Quantisierung speichert dieselben Gewichte mit weniger Bit. Die Datei schrumpft, der Speicherbedarf sinkt – und weil Inferenz auf üblicher Hardware häufig durch die Speicherbandbreite begrenzt ist, nicht durch Rechenleistung, kann eine kleinere Variante zusätzlich schneller antworten.

Der Preis ist ein möglicher Qualitätsverlust. Wie groß er ausfällt, hängt vom Modell ab, vom Quantisierungsverfahren, von der Aufgabe, von der Sprache, von der Kontextlänge und von der Stufe. Es gibt keinen allgemeingültigen Prozentwert „erhaltener Qualität”, und Aussagen dieser Form sollten Sie grundsätzlich misstrauisch machen.

Die Stufen, die in unserem Filter vorkommen:

Die beiden K-Quant-Varianten von Muse Glimmer

Meta veröffentlicht Muse Glimmer 30B in zwei ungewöhnlichen GGUF-Dateien mit durchschnittlich ungefähr vier Bit pro Gewicht. K-Quant Dynamic bewahrt ausgewählte Tensoren in höherer Präzision und zielt auf 32 GB VRAM; K-Quant 17GB komprimiert stärker und zielt auf 24 GB. Es sind keine Q4_K_M-Dateien. Deshalb behalten wir die exakten Namen bei und bewerten beide als getrennte Varianten. Beide stehen im breiten Q4-Filter, der praktische Downloads der Vier-Bit-Klasse bündelt, ohne ein identisches Zahlenformat zu behaupten.

Meta nennt über fünfzehn verbreitete Benchmarks eine durchschnittliche Verschlechterung von 0,2 % beziehungsweise 1,0 %. Das sind Messungen des Herausgebers, keine AIWB-Schreibwerte und keine Garantie für deutsche, englische, französische oder spanische Prosa. Unser Ranking und der direkte Vergleich messen beide Dateien getrennt an nativ verfassten Schreibaufgaben.

Welche Hardware für welches Modell?

8 GB

Gemma 4 E2B Q8_0 🏠

14.2 · lokaler Rang 39

Gemma 4 E2B Q4_K_M 💡 on* 🏠

39.4 tok/s · AIWB-Messung auf Strix Halo

16 GB

Gemma 4 12B Q8_0 🏠

60.3 · lokaler Rang 12

Gemma 4 E2B Q4_K_M 💡 on* 🏠

39.4 tok/s · AIWB-Messung auf Strix Halo

32 GB

Gemma 4 26B A4B Q8_0 💡 on* 🏠

70.2 · lokaler Rang 3

Gemma 4 26B A4B Q8_0 🏠

39.8 tok/s · AIWB-Messung auf Strix Halo

Lade-Richtwerte, keine Garantien: Kontext, KV-Cache, Batch und Laufzeit verändern den Bedarf. AIWB-Geschwindigkeiten stammen von dem unter „Über“ beschriebenen Strix-Halo-System und sagen keine andere Plattform voraus.

Qualität gegen Geschwindigkeit

Beide Größen laufen auf dieser Seite parallel, aber getrennt. Das Ranking bewertet ausschließlich, wie gut die deutschen Texte sind. Wie schnell eine Variante antwortet und wie viel Speicher sie belegt, sind Hardwarefragen – wichtig für die Auswahl, aber kein Qualitätsmerkmal.

Für die Praxis heißt das: Wer redigiert, überarbeitet oder längere Passagen schreiben lässt, fährt meist besser mit der höherwertigen Variante und wartet ein paar Sekunden länger. Wer interaktiv arbeitet, viele kurze Anläufe braucht oder in einem Editor mitschreiben lässt, wird die schnellere Alternative bevorzugen. Beide Wege stehen in jedem Speichersegment nebeneinander.

Häufige Fragen

Welche lokale KI schreibt am besten auf Deutsch? Die aktuell bestplatzierte Variante steht oben in der Tabelle. Wir nennen hier bewusst keinen festen Namen, weil sich die Reihenfolge mit jeder neuen Auswertung ändern kann. Achten Sie darauf, nicht nur den Modellnamen, sondern auch Quantisierung und Denkmodus zu übernehmen.

Wie viel VRAM brauche ich mindestens? Der konkrete Bedarf hängt von Variante und Kontext ab. Der Reiter „Dedizierte GPU” zeigt für 8, 16 und 32 GB, ob eine bewertete Variante mit der angesetzten Reserve hineinpasst; fehlt eine belastbare Empfehlung, bleibt die Karte leer. Rechnen Sie zusätzlich Platz für den KV-Cache ein, wenn Sie mit langem Kontext arbeiten.

Ist Q4 schlechter als Q8? Sie kann schlechter sein, aber Richtung und Stärke hängen vom Modell, vom Verfahren und von der Aufgabe ab. Q4 QAT und nachträgliches Q4_K_M sind dabei nicht gleichzusetzen. Belastbare Aussagen machen wir nur dort, wo uns direkte Vergleiche desselben Checkpoints im selben Denkmodus vorliegen.

Warum stehen Modelle ab 256 Milliarden Parametern nicht im Ranking? Weil diese Seite auf persönliche Rechner und kompakte Workstations begrenzt bleibt; größere Systeme sind damit nicht grundsätzlich unmöglich. Die Grenze bezieht sich auf die Gesamtparameter, auch bei Mixture-of-Experts-Modellen – der Speicherbedarf richtet sich nach ihnen, nicht nach den aktiven Parametern.

Warum werden Varianten desselben Modells getrennt gelistet? Weil sie sich unterschiedlich verhalten. Eine Q8-Variante mit aktivem Denkmodus ist ein anderes System als eine Q4-Variante ohne. Ein Durchschnittswert über beide würde Ihnen genau die Information nehmen, die Sie zum Herunterladen brauchen.

Was bedeutet „Reasoning unbekannt”? Dass wir aus den vorliegenden technischen Belegen nicht sicher ableiten können, ob während der Generierung tatsächlich gedacht wurde. Eine entsprechende Anforderung in der Konfiguration genügt uns nicht als Nachweis, wenn die Laufzeitumgebung keine Reasoning-Token meldet.

Zählt es gegen ein Modell, wenn es auch gegen Cloud-Modelle antreten musste? Nein. Die Punktzahlen stammen aus dem gemeinsamen deutschen Ranking, damit alle Varianten auf derselben Skala und mit möglichst vielen Vergleichen bewertet werden. Für diese Seite wird nur gefiltert und neu nummeriert.

Sind offene Gewichte dasselbe wie Open Source? Nein. Offene Gewichte bedeuten, dass Sie das Modell herunterladen und lokal ausführen können. Ob die Lizenz frei ist und ob Trainingsdaten offenliegen, ist davon unabhängig – und sollte für kommerzielle Nutzung separat geprüft werden.