Source: https://eschatialabs.com/tr/benchmarks/tholos-bench/

[Tüm testler](https://eschatialabs.com/tr/benchmarks/)

Karşılaştırma testi · Kendi bilgisayarınızda yapay zekâ

# Tholos-Bench

Küçük yapay zekâ asistanları için 160 çalışma alanı görevi; asistan işini bitirdiğinde çalışma alanının son hâline göre puanlanır.

[Veri seti (Hugging Face)](https://huggingface.co/datasets/mertkayacs/tholos-bench)

Her senaryo asistanlar, araçlar, tablolar ve notlar içeren bir Tholos çalışma alanı kurar ve asistanlardan birine bir görev verir. Bir deneme yalnızca son durum tüm denetimleri geçerse başarılı sayılır: doğru satır eklenmiş, görev doğru ekip arkadaşına gitmiş, yasak bir araç çağrılmamış olmalıdır.

14 kategori, tablo düzenlemeleri ve görev devirlerinden onaylara, yazma çakışmalarına, kaydedilmiş sayfalarda web araştırmasına, sayfalara ya da notlara gizlenmiş talimatlara ve doğru hamlenin hiçbir şey yapmamak olduğu görevlere kadar uzanır.

**Senaryo**: 14 kategoride 160

**Dil**: İngilizce

**Biçim**: Her senaryo için bir JSON dosyası; Hugging Face’te JSON Lines olarak da

**Ayarlar**: Sıcaklık 0 (her çalıştırmada aynı yanıt), 16.384 token’lık bağlam, sabit saat

**Lisans**: Apache-2.0

**Yayın tarihi**: 1 Ekim 2026, Tholos 0.1.0 ile

## Sonuçlar

Tek bir Kaggle T4 grafik kartı, llama.cpp, Q4_K_M model dosyaları (ağırlık başına yaklaşık 4 bite sıkıştırılmış), JSON şemasına bağlı çıktı

| Model | Dosya | Başarılı (160 üzerinden) | Gizli talimat (12 üzerinden) |
| --- | --- | --- | --- |
| Qwen3.5-2B | 1,28 GB | 97 | 4 |
| MiniCPM5-2B | 1,56 GB | 112 | 8 |
| Tholos-2B | 1,56 GB | 137 | 10 |
| Llama 3.2 3B Instruct | 2,02 GB | 37 | 1 |
| Granite 4.2-3B | 2,24 GB | 129 | 7 |
| Qwen3.5-4B | 2,74 GB | 141 | 6 |

### Sınırlar

Tholos-2B, MiniCPM5-2B temel alınarak eğitildi ve tablodaki modeller arasında bu adım biçimi için eğitilen tek model. Bilgisayarın ana işlemcisinde (CPU) llama.cpp ile MiniCPM5-2B 117, Tholos-2B 134 senaryoyu geçiyor; puanları yalnızca aynı kurulumda alınan sonuçlarla karşılaştırın.

## Nasıl çalıştırılır

Bir model sunucusu başlatın, Tholos’u kurun ve testin tamamını çalıştırın. Yalnızca bir bölümünü çalıştırmak için --only ile bir kategori adı verin.

```
llama-server -hf mertkayacs/Tholos-2B-GGUF:Q4_K_M --jinja -c 16384 -t 4 -a tholos-2b --host 127.0.0.1 --port 8080
uv tool install git+https://github.com/mertkayacs/tholos
tholos bench --base-url http://127.0.0.1:8080/v1 --model tholos-2b
```

## Atıf

```
@misc{kaya2026tholosbench,
  author = {Kaya, Mert},
  title = {Tholos-Bench: Workspace Tasks for Small AI Assistants},
  publisher = {Eschatia Labs},
  year = {2026},
  url = {https://huggingface.co/datasets/mertkayacs/tholos-bench}
}
```

## Bağlantılar

- [Veri seti (Hugging Face)](https://huggingface.co/datasets/mertkayacs/tholos-bench)
- [Kod (GitHub)](https://github.com/mertkayacs/tholos/tree/main/tholos/bench)
- [Proje sitesi](https://tholos.mertkayacs.com/tr/)
- [Teknik rapor](https://eschatialabs.com/tr/research/tholos-2b-report/)
