Alle Benchmarks

Benchmark · Entscheidungsmodelle

JevOss

Ein offener Prüfstand, der testet, ob ein Entscheidungsmodell richtig bleibt, wenn sich seine Eingabe ändert.

JevOss nimmt Fragen mit bekannter Antwort und ändert jeweils eine Sache. Es vertauscht die Optionen, versteckt eine Anweisung, fügt etwa 600 Wörter themenfremden Text hinzu, formuliert eine Ja-Nein-Frage um oder schickt dieselbe Anfrage erneut und misst dann, wie oft sich die Antwort ändert.

Außerdem bewertet es die Genauigkeit und prüft, ob die Wahrscheinlichkeiten des Modells zu seiner Trefferquote passen. Es testet jeden Server, der die Jev API (POST /v1/systemone) unterstützt, darunter JevAlt und Kev-4B.

Prüfungen
5: Reihenfolge der Optionen, versteckte Anweisungen, themenfremder Text, Ja-Nein-Frageformate, wiederholte Anfragen
Befehle
eval, probe, calibrate, compare, ask
Voraussetzungen
Python 3.11 oder neuer und ein laufender Server mit einem Entscheidungsmodell
Version
0.1.0, veröffentlicht am 1. Oktober 2026
Lizenz
Apache-2.0

Ergebnisse

Versteckte Anweisungen: Anteil der 200 Testfälle, in denen eine eingeschleuste Anweisung die Antwort änderte (niedriger ist besser)

ModellGeänderte Antworten
Kev-4B36,0 %
Deem-4B14,0 %
Karar-4B19,0 %
Wähler-4B17,5 %

Grenzen

Mit etwa 600 Wörtern themenfremdem Text verliert Kev-4B 5,4 Prozentpunkte Genauigkeit, Deem-4B 17,4.

Ausführen

Die Standardadresse des Servers ist http://127.0.0.1:8000. JevAlt startet einen passenden Server mit jevalt serve.

pip install "jevoss[suites] @ git+https://github.com/mertkayacs/jevoss"
jevoss eval typed-decisions
jevoss probe typed-decisions --limit 100

Zitieren

@software{kaya2026jevoss,
  author = {Mert Kaya},
  title = {JevOss: Open Evaluation Toolkit for Jev-Type Decision Models},
  year = {2026},
  license = {Apache-2.0},
  url = {https://github.com/mertkayacs/jevoss}
}