Benchmark · KI auf dem eigenen Computer
Tholos-Bench
160 Aufgaben im Arbeitsbereich für kleine KI-Assistenten, bewertet anhand des Endzustands des Arbeitsbereichs.
Ergebnisse
Eine Kaggle-T4-Grafikkarte, llama.cpp, Q4_K_M-Modelldateien (auf etwa 4 Bit pro Gewicht komprimiert), Ausgabe nach JSON-Schema
| Modell | Datei | Bestanden (von 160) | Versteckte Anweisungen (von 12) |
|---|---|---|---|
| Qwen3.5-2B | 1,28 GB | 97 | 4 |
| MiniCPM5-2B | 1,56 GB | 112 | 8 |
| Tholos-2B | 1,56 GB | 137 | 10 |
| Llama 3.2 3B Instruct | 2,02 GB | 37 | 1 |
| Granite 4.2-3B | 2,24 GB | 129 | 7 |
| Qwen3.5-4B | 2,74 GB | 141 | 6 |
Grenzen
Tholos-2B wurde auf Basis von MiniCPM5-2B trainiert und ist das einzige Modell der Tabelle, das auf dieses Schrittformat trainiert wurde. Auf dem Hauptprozessor (CPU) mit llama.cpp bestehen MiniCPM5-2B 117 und Tholos-2B 134 Szenarien; vergleichen Sie Werte daher nur innerhalb derselben Konfiguration.
Ausführen
Starten Sie einen Modellserver, installieren Sie Tholos und führen Sie den ganzen Benchmark aus. Mit --only und einem Kategorienamen läuft nur ein Teil.
llama-server -hf mertkayacs/Tholos-2B-GGUF:Q4_K_M --jinja -c 16384 -t 4 -a tholos-2b --host 127.0.0.1 --port 8080
uv tool install git+https://github.com/mertkayacs/tholos
tholos bench --base-url http://127.0.0.1:8080/v1 --model tholos-2b Zitieren
@misc{kaya2026tholosbench,
author = {Kaya, Mert},
title = {Tholos-Bench: Workspace Tasks for Small AI Assistants},
publisher = {Eschatia Labs},
year = {2026},
url = {https://huggingface.co/datasets/mertkayacs/tholos-bench}
}