Source: https://eschatialabs.com/de/benchmarks/jevalt-bench/

[Alle Benchmarks](https://eschatialabs.com/de/benchmarks/)

Benchmark · Entscheidungsmodelle

# jevalt-bench

3.116 Fallbeschreibungen auf Englisch, Türkisch und Deutsch für Entscheidungsmodelle, die eine Option wählen und eine Wahrscheinlichkeit angeben.

[Datensatz (Hugging Face)](https://huggingface.co/datasets/mertkayacs/jevalt-bench)

1.300 Downloads auf Hugging Face, Stand: 10. Oktober 2026.

Jede Zeile beschreibt eine Situation, etwa eine E-Mail, eine Richtlinie oder eine Chatnachricht, und stellt dazu eine oder mehrere Fragen, bei denen das Modell eine Option wählt, eine Bewertung abgibt oder die Wahrscheinlichkeit für „Ja“ schätzt.

Bewertet wird, wie oft ein Modell richtig antwortet und wie nah seine Wahrscheinlichkeiten an seiner tatsächlichen Trefferquote liegen. Das zweite Maß ist der Brier-Score; niedriger ist besser.

**Zeilen**: 3.116: Englisch 1.277, Türkisch 1.019, Deutsch 820

**Fragen**: 8.434

**Format**: JSON Lines, eine Teilmenge pro Sprache

**Lizenz**: Für das Projekt geschriebene Zeilen Apache-2.0; übernommene Zeilen behalten die Lizenz ihrer Quelle (MASSIVE CC BY 4.0, Open-Jev CC0, PAWS-X frei nutzbar mit Nennung von Google, typed-decisions Apache-2.0)

**Veröffentlicht**: 1. Oktober 2026

## Ergebnisse

Genauigkeit und Brier-Score auf den Testfragen

| Sprache | Kev-4B | JevAlt | Brier, Kev-4B | Brier, JevAlt |
| --- | --- | --- | --- | --- |
| Englisch | 84,7 % | Deem-4B 94,7 % | 0,256 | 0,091 |
| Türkisch | 87,1 % | Karar-4B 96,8 % | 0,214 | 0,058 |
| Deutsch | 81,1 % | Wähler-4B 92,0 % | 0,298 | 0,119 |

### Grenzen

Test- und Trainingszeilen stammen aus derselben Datenpipeline; die Werte messen daher JevAlts eigene Aufgabe. Auf dem deutschen Nachrichtendatensatz 10kGNAD erreicht Kev-4B 65,3 % und Wähler-4B 62,5 %.

## Ausführen

Laden Sie eine Sprache mit der Hugging-Face-Bibliothek datasets. Um Ihr eigenes Modell auf diesen Zeilen zu bewerten, richten Sie JevOss auf einen Server, der die Jev API unterstützt.

```
from datasets import load_dataset

test = load_dataset("mertkayacs/jevalt-bench", "en", split="test")
print(test[0])
```

## Zitieren

```
@techreport{kaya2026jevaltreport,
  author = {Kaya, Mert},
  title = {JevAlt: Technical report},
  institution = {Eschatia Labs},
  year = {2026},
  url = {https://eschatialabs.com/research/jevalt-report/},
  note = {Technical report, not peer-reviewed}
}
```

## Links

- [Datensatz (Hugging Face)](https://huggingface.co/datasets/mertkayacs/jevalt-bench)
- [Code (GitHub)](https://github.com/mertkayacs/jevalt)
- [Projektseite](https://jevalt.mertkayacs.com/de/)
- [Technischer Bericht](https://eschatialabs.com/de/research/jevalt-report/)
