Source: https://eschatialabs.com/tr/benchmarks/jevalt-bench/

[Tüm testler](https://eschatialabs.com/tr/benchmarks/)

Karşılaştırma testi · Karar modelleri

# jevalt-bench

Seçenekler arasından seçim yapan ve olasılık veren karar modelleri için İngilizce, Türkçe ve Almanca 3.116 durum metni.

[Veri seti (Hugging Face)](https://huggingface.co/datasets/mertkayacs/jevalt-bench)

10 Ekim 2026 itibarıyla Hugging Face’te 1.300 indirme.

Her satır bir durumu anlatır (örneğin bir e-posta, bir kural metni ya da bir sohbet mesajı) ve bu durumla ilgili bir veya daha fazla soru içerir. Sorular modelden bir seçenek belirlemesini, puan vermesini ya da “evet” yanıtının olasılığını tahmin etmesini ister.

Model iki açıdan puanlanır: ne sıklıkla doğru yanıt verdiği ve verdiği olasılıkların gerçek doğruluk oranına ne kadar yakın olduğu. İkinci ölçü Brier puanıdır; ne kadar düşükse o kadar iyidir.

**Satır**: 3.116: İngilizce 1.277, Türkçe 1.019, Almanca 820

**Soru**: 8.434

**Biçim**: JSON Lines, her dil için ayrı bir alt küme

**Lisans**: Projede yazılan satırlar Apache-2.0; dönüştürülen satırlar kaynaklarının lisansını korur (MASSIVE CC BY 4.0, Open-Jev CC0, PAWS-X Google’a atıfla serbest, typed-decisions Apache-2.0)

**Yayın tarihi**: 1 Ekim 2026

## Sonuçlar

Test sorularında doğruluk ve Brier puanı

| Dil | Kev-4B | JevAlt | Brier, Kev-4B | Brier, JevAlt |
| --- | --- | --- | --- | --- |
| İngilizce | %84,7 | Deem-4B %94,7 | 0,256 | 0,091 |
| Türkçe | %87,1 | Karar-4B %96,8 | 0,214 | 0,058 |
| Almanca | %81,1 | Wähler-4B %92,0 | 0,298 | 0,119 |

### Sınırlar

Test ve eğitim satırları aynı veri üretim sürecinden geliyor; bu yüzden puanlar JevAlt’ın kendi görevini ölçer. Almanca haber veri seti 10kGNAD’de Kev-4B %65,3, Wähler-4B %62,5 alıyor.

## Nasıl çalıştırılır

Bir dilin verilerini Hugging Face’in datasets kütüphanesiyle yükleyin. Kendi modelinizi bu satırlarla puanlamak için JevOss’u kullanın; JevOss satırları Jev API’yi destekleyen herhangi bir sunucuya gönderir.

```
from datasets import load_dataset

test = load_dataset("mertkayacs/jevalt-bench", "en", split="test")
print(test[0])
```

## Atıf

```
@techreport{kaya2026jevaltreport,
  author = {Kaya, Mert},
  title = {JevAlt: Technical report},
  institution = {Eschatia Labs},
  year = {2026},
  url = {https://eschatialabs.com/research/jevalt-report/},
  note = {Technical report, not peer-reviewed}
}
```

## Bağlantılar

- [Veri seti (Hugging Face)](https://huggingface.co/datasets/mertkayacs/jevalt-bench)
- [Kod (GitHub)](https://github.com/mertkayacs/jevalt)
- [Proje sitesi](https://jevalt.mertkayacs.com/tr/)
- [Teknik rapor](https://eschatialabs.com/tr/research/jevalt-report/)
