Karşılaştırma testi · Karar modelleri
jevalt-bench
Seçenekler arasından seçim yapan ve olasılık veren karar modelleri için İngilizce, Türkçe ve Almanca 3.116 durum metni.
Veri seti (Hugging Face)
10 Ekim 2026 itibarıyla Hugging Face’te 1.300 indirme.
Sonuçlar
Test sorularında doğruluk ve Brier puanı
| Dil | Kev-4B | JevAlt | Brier, Kev-4B | Brier, JevAlt |
|---|---|---|---|---|
| İngilizce | %84,7 | Deem-4B %94,7 | 0,256 | 0,091 |
| Türkçe | %87,1 | Karar-4B %96,8 | 0,214 | 0,058 |
| Almanca | %81,1 | Wähler-4B %92,0 | 0,298 | 0,119 |
Sınırlar
Test ve eğitim satırları aynı veri üretim sürecinden geliyor; bu yüzden puanlar JevAlt’ın kendi görevini ölçer. Almanca haber veri seti 10kGNAD’de Kev-4B %65,3, Wähler-4B %62,5 alıyor.
Nasıl çalıştırılır
Bir dilin verilerini Hugging Face’in datasets kütüphanesiyle yükleyin. Kendi modelinizi bu satırlarla puanlamak için JevOss’u kullanın; JevOss satırları Jev API’yi destekleyen herhangi bir sunucuya gönderir.
from datasets import load_dataset
test = load_dataset("mertkayacs/jevalt-bench", "en", split="test")
print(test[0]) Atıf
@techreport{kaya2026jevaltreport,
author = {Kaya, Mert},
title = {JevAlt: Technical report},
institution = {Eschatia Labs},
year = {2026},
url = {https://eschatialabs.com/research/jevalt-report/},
note = {Technical report, not peer-reviewed}
}