Karşılaştırma testi · Kendi bilgisayarınızda yapay zekâ
Tholos-Bench
Küçük yapay zekâ asistanları için 160 çalışma alanı görevi; asistan işini bitirdiğinde çalışma alanının son hâline göre puanlanır.
Sonuçlar
Tek bir Kaggle T4 grafik kartı, llama.cpp, Q4_K_M model dosyaları (ağırlık başına yaklaşık 4 bite sıkıştırılmış), JSON şemasına bağlı çıktı
| Model | Dosya | Başarılı (160 üzerinden) | Gizli talimat (12 üzerinden) |
|---|---|---|---|
| Qwen3.5-2B | 1,28 GB | 97 | 4 |
| MiniCPM5-2B | 1,56 GB | 112 | 8 |
| Tholos-2B | 1,56 GB | 137 | 10 |
| Llama 3.2 3B Instruct | 2,02 GB | 37 | 1 |
| Granite 4.2-3B | 2,24 GB | 129 | 7 |
| Qwen3.5-4B | 2,74 GB | 141 | 6 |
Sınırlar
Tholos-2B, MiniCPM5-2B temel alınarak eğitildi ve tablodaki modeller arasında bu adım biçimi için eğitilen tek model. Bilgisayarın ana işlemcisinde (CPU) llama.cpp ile MiniCPM5-2B 117, Tholos-2B 134 senaryoyu geçiyor; puanları yalnızca aynı kurulumda alınan sonuçlarla karşılaştırın.
Nasıl çalıştırılır
Bir model sunucusu başlatın, Tholos’u kurun ve testin tamamını çalıştırın. Yalnızca bir bölümünü çalıştırmak için --only ile bir kategori adı verin.
llama-server -hf mertkayacs/Tholos-2B-GGUF:Q4_K_M --jinja -c 16384 -t 4 -a tholos-2b --host 127.0.0.1 --port 8080
uv tool install git+https://github.com/mertkayacs/tholos
tholos bench --base-url http://127.0.0.1:8080/v1 --model tholos-2b Atıf
@misc{kaya2026tholosbench,
author = {Kaya, Mert},
title = {Tholos-Bench: Workspace Tasks for Small AI Assistants},
publisher = {Eschatia Labs},
year = {2026},
url = {https://huggingface.co/datasets/mertkayacs/tholos-bench}
}