Tüm testler

Karşılaştırma testi · Karar modelleri

jevalt-bench

Seçenekler arasından seçim yapan ve olasılık veren karar modelleri için İngilizce, Türkçe ve Almanca 3.116 durum metni.

Veri seti (Hugging Face)

10 Ekim 2026 itibarıyla Hugging Face’te 1.300 indirme.

Her satır bir durumu anlatır (örneğin bir e-posta, bir kural metni ya da bir sohbet mesajı) ve bu durumla ilgili bir veya daha fazla soru içerir. Sorular modelden bir seçenek belirlemesini, puan vermesini ya da “evet” yanıtının olasılığını tahmin etmesini ister.

Model iki açıdan puanlanır: ne sıklıkla doğru yanıt verdiği ve verdiği olasılıkların gerçek doğruluk oranına ne kadar yakın olduğu. İkinci ölçü Brier puanıdır; ne kadar düşükse o kadar iyidir.

Satır
3.116: İngilizce 1.277, Türkçe 1.019, Almanca 820
Soru
8.434
Biçim
JSON Lines, her dil için ayrı bir alt küme
Lisans
Projede yazılan satırlar Apache-2.0; dönüştürülen satırlar kaynaklarının lisansını korur (MASSIVE CC BY 4.0, Open-Jev CC0, PAWS-X Google’a atıfla serbest, typed-decisions Apache-2.0)
Yayın tarihi
1 Ekim 2026

Sonuçlar

Test sorularında doğruluk ve Brier puanı

DilKev-4BJevAltBrier, Kev-4BBrier, JevAlt
İngilizce%84,7Deem-4B %94,70,2560,091
Türkçe%87,1Karar-4B %96,80,2140,058
Almanca%81,1Wähler-4B %92,00,2980,119

Sınırlar

Test ve eğitim satırları aynı veri üretim sürecinden geliyor; bu yüzden puanlar JevAlt’ın kendi görevini ölçer. Almanca haber veri seti 10kGNAD’de Kev-4B %65,3, Wähler-4B %62,5 alıyor.

Nasıl çalıştırılır

Bir dilin verilerini Hugging Face’in datasets kütüphanesiyle yükleyin. Kendi modelinizi bu satırlarla puanlamak için JevOss’u kullanın; JevOss satırları Jev API’yi destekleyen herhangi bir sunucuya gönderir.

from datasets import load_dataset

test = load_dataset("mertkayacs/jevalt-bench", "en", split="test")
print(test[0])

Atıf

@techreport{kaya2026jevaltreport,
  author = {Kaya, Mert},
  title = {JevAlt: Technical report},
  institution = {Eschatia Labs},
  year = {2026},
  url = {https://eschatialabs.com/research/jevalt-report/},
  note = {Technical report, not peer-reviewed}
}