Hinweis (Stand 26.08.2026): Die Judge-Bewertungen dieses Stands werden derzeit überprüft. Ein Audit hat Schwächen der Bewertungsregeln gezeigt (u. a. Halluzinations-Prompt ohne Fragenkontext, Zähl-Kriterien per LLM, E-Mail-Caps bei 09h/09j). Eine überarbeitete Bewertung (Scoring v2, Sandbox-Tests für Code, geprüfte Kriterien) folgt als eigener Stand; diese Zahlen bleiben unverändert erhalten.
Test-Setup: Modus non-thinking, wo konfigurierbar · Runtime llama.cpp (Docker- oder unsloth-Build) bzw. NInfer, siehe Badge pro Modell · Sampling Author-empfohlen pro Modell. Vollständige Beschreibung im Tab Methodik.
Judge:
Getestete Kategorien
10 Fragen aus verschiedenen Disziplinen. Jedes Modell beantwortet jede Frage n-mal (n aus Frage-YAML).
Klick auf einen Chip springt zur Frage im „Gewinner pro Disziplin"-Block darunter.
Wie schwer war jede Disziplin?
⌀ Score aller Modelle pro Disziplin (0–10). Sortiert von schwer nach leicht.
Zeigt sofort, wo die Modelle als Kohorte scheitern.
Reasoning-Impact — lohnt sich Thinking?
Nur Modelle mit direktem OFF/ON-Paar (gleiche Basis, einmal mit deaktiviertem, einmal mit aktiviertem Reasoning).
Zeigt was Thinking kostet und was es bringt.
Modelle im Test
(Legende Thinking:
ON = fest an,
OFF = im Test aus,
n/a = nicht verfügbar)
Modell
Groesse (B)
Quant.
GGUF (GB)
VRAM (GB)
KV-Cache (GB)
Kontext
tok/s (⌀)
Antwortzeit
Thinking
Sampling
Erfolgsquote (⌀)
Score /100
Gewinner pro Disziplin
Top 3 pro Frage. Basis: ⌀ Score /10 (Judge- und deterministische Bewertung).
Modelle ohne Bewertung erscheinen nicht. Filter „baked-in ausblenden" gilt auch hier.
Frage
Disziplin
1. Platz
2. Platz
3. Platz
Erfolgsquote pro Modell × Frage
Klick auf eine Zelle: Antworten dieser Modell-Frage-Kombination ansehen.
Speed vs. Score — welches Modell für welche Anforderung
Jeder Punkt ist ein Modell. X-Achse: Generierungsgeschwindigkeit in Tokens/Sekunde. Y-Achse: Score /100 (Qwen-Q4-Judge).
Punktgröße = VRAM-Verbrauch. Farbe = Runtime. Die orange Pareto-Frontier verbindet die Modelle, die für ihren Speed keinen besseren Score-Wettbewerber haben — alles unter dieser Linie ist strikt dominiert.
Lade Judge-Analyse …
Lade Methodik …
Leaderboard
Ranking nach Gesamt-Score (Summe aus ⌀ Score pro Disziplin, max 100).
Bei gleichem Score gewinnt das kleinere Modell. Filter „baked-in ausblenden" gilt.