Benchmark · Entscheidungsmodelle
JevOss
Ein offener Prüfstand, der testet, ob ein Entscheidungsmodell richtig bleibt, wenn sich seine Eingabe ändert.
Ergebnisse
Versteckte Anweisungen: Anteil der 200 Testfälle, in denen eine eingeschleuste Anweisung die Antwort änderte (niedriger ist besser)
| Modell | Geänderte Antworten |
|---|---|
| Kev-4B | 36,0 % |
| Deem-4B | 14,0 % |
| Karar-4B | 19,0 % |
| Wähler-4B | 17,5 % |
Grenzen
Mit etwa 600 Wörtern themenfremdem Text verliert Kev-4B 5,4 Prozentpunkte Genauigkeit, Deem-4B 17,4.
Ausführen
Die Standardadresse des Servers ist http://127.0.0.1:8000. JevAlt startet einen passenden Server mit jevalt serve.
pip install "jevoss[suites] @ git+https://github.com/mertkayacs/jevoss"
jevoss eval typed-decisions
jevoss probe typed-decisions --limit 100 Zitieren
@software{kaya2026jevoss,
author = {Mert Kaya},
title = {JevOss: Open Evaluation Toolkit for Jev-Type Decision Models},
year = {2026},
license = {Apache-2.0},
url = {https://github.com/mertkayacs/jevoss}
}