Benchmark · Entscheidungsmodelle
jevalt-bench
3.116 Fallbeschreibungen auf Englisch, Türkisch und Deutsch für Entscheidungsmodelle, die eine Option wählen und eine Wahrscheinlichkeit angeben.
Datensatz (Hugging Face)
1.300 Downloads auf Hugging Face, Stand: 10. Oktober 2026.
Ergebnisse
Genauigkeit und Brier-Score auf den Testfragen
| Sprache | Kev-4B | JevAlt | Brier, Kev-4B | Brier, JevAlt |
|---|---|---|---|---|
| Englisch | 84,7 % | Deem-4B 94,7 % | 0,256 | 0,091 |
| Türkisch | 87,1 % | Karar-4B 96,8 % | 0,214 | 0,058 |
| Deutsch | 81,1 % | Wähler-4B 92,0 % | 0,298 | 0,119 |
Grenzen
Test- und Trainingszeilen stammen aus derselben Datenpipeline; die Werte messen daher JevAlts eigene Aufgabe. Auf dem deutschen Nachrichtendatensatz 10kGNAD erreicht Kev-4B 65,3 % und Wähler-4B 62,5 %.
Ausführen
Laden Sie eine Sprache mit der Hugging-Face-Bibliothek datasets. Um Ihr eigenes Modell auf diesen Zeilen zu bewerten, richten Sie JevOss auf einen Server, der die Jev API unterstützt.
from datasets import load_dataset
test = load_dataset("mertkayacs/jevalt-bench", "en", split="test")
print(test[0]) Zitieren
@techreport{kaya2026jevaltreport,
author = {Kaya, Mert},
title = {JevAlt: Technical report},
institution = {Eschatia Labs},
year = {2026},
url = {https://eschatialabs.com/research/jevalt-report/},
note = {Technical report, not peer-reviewed}
}