Source: https://eschatialabs.com/de/benchmarks/tholos-bench/

[Alle Benchmarks](https://eschatialabs.com/de/benchmarks/)

Benchmark · KI auf dem eigenen Computer

# Tholos-Bench

160 Aufgaben im Arbeitsbereich für kleine KI-Assistenten, bewertet anhand des Endzustands des Arbeitsbereichs.

[Datensatz (Hugging Face)](https://huggingface.co/datasets/mertkayacs/tholos-bench)

Jedes Szenario richtet einen Tholos-Arbeitsbereich mit Assistenten, Werkzeugen, Tabellen und Notizen ein und gibt einem Assistenten eine Aufgabe. Der Lauf gilt nur als bestanden, wenn der Endzustand die Prüfungen erfüllt: Die richtige Zeile wurde ergänzt, die Aufgabe ging an das richtige Teammitglied, kein verbotenes Werkzeug wurde aufgerufen.

Die 14 Kategorien reichen von Tabellenänderungen und Übergaben über Freigaben, Schreibkonflikte und Webrecherche auf gespeicherten Seiten bis zu Anweisungen, die in Seiten oder Notizen versteckt sind, und zu Aufgaben, bei denen Nichtstun richtig ist.

**Szenarien**: 160 in 14 Kategorien

**Sprache**: Englisch

**Format**: Eine JSON-Datei pro Szenario, auf Hugging Face auch als JSON Lines

**Einstellungen**: Temperatur 0 (bei jedem Lauf dieselbe Antwort), Kontext von 16.384 Tokens, feste Uhrzeit

**Lizenz**: Apache-2.0

**Veröffentlicht**: 1. Oktober 2026, mit Tholos 0.1.0

## Ergebnisse

Eine Kaggle-T4-Grafikkarte, llama.cpp, Q4_K_M-Modelldateien (auf etwa 4 Bit pro Gewicht komprimiert), Ausgabe nach JSON-Schema

| Modell | Datei | Bestanden (von 160) | Versteckte Anweisungen (von 12) |
| --- | --- | --- | --- |
| Qwen3.5-2B | 1,28 GB | 97 | 4 |
| MiniCPM5-2B | 1,56 GB | 112 | 8 |
| Tholos-2B | 1,56 GB | 137 | 10 |
| Llama 3.2 3B Instruct | 2,02 GB | 37 | 1 |
| Granite 4.2-3B | 2,24 GB | 129 | 7 |
| Qwen3.5-4B | 2,74 GB | 141 | 6 |

### Grenzen

Tholos-2B wurde auf Basis von MiniCPM5-2B trainiert und ist das einzige Modell der Tabelle, das auf dieses Schrittformat trainiert wurde. Auf dem Hauptprozessor (CPU) mit llama.cpp bestehen MiniCPM5-2B 117 und Tholos-2B 134 Szenarien; vergleichen Sie Werte daher nur innerhalb derselben Konfiguration.

## Ausführen

Starten Sie einen Modellserver, installieren Sie Tholos und führen Sie den ganzen Benchmark aus. Mit --only und einem Kategorienamen läuft nur ein Teil.

```
llama-server -hf mertkayacs/Tholos-2B-GGUF:Q4_K_M --jinja -c 16384 -t 4 -a tholos-2b --host 127.0.0.1 --port 8080
uv tool install git+https://github.com/mertkayacs/tholos
tholos bench --base-url http://127.0.0.1:8080/v1 --model tholos-2b
```

## Zitieren

```
@misc{kaya2026tholosbench,
  author = {Kaya, Mert},
  title = {Tholos-Bench: Workspace Tasks for Small AI Assistants},
  publisher = {Eschatia Labs},
  year = {2026},
  url = {https://huggingface.co/datasets/mertkayacs/tholos-bench}
}
```

## Links

- [Datensatz (Hugging Face)](https://huggingface.co/datasets/mertkayacs/tholos-bench)
- [Code (GitHub)](https://github.com/mertkayacs/tholos/tree/main/tholos/bench)
- [Projektseite](https://tholos.mertkayacs.com/de/)
- [Technischer Bericht](https://eschatialabs.com/de/research/tholos-2b-report/)
