docs / guides / run-benchmarks

Benchmarks draaien

Meet je modellen op jouw hardware zodat de router echte cijfers heeft. Vijf commando's, twee smaken, één JSON-output die de router automatisch oppikt.

Twee modes

ModeCommandoTijd per modelWanneer
Quickpython -m benchmarks --quick~4 minutenNa eerste install, na pullen van een nieuw model
Fullpython -m benchmarks~15 minutenVoordat je op routing leunt voor belangrijke workloads

Gerichte runs

# één model, alle categorieën
python -m benchmarks --model qwen2.5-coder:7b
# één categorie, alle geïnstalleerde modellen
python -m benchmarks --category reasoning
# combineer
python -m benchmarks --model deepseek-r1:7b --category code_generation

Waar resultaten landen

Resultaten gaan naar benchmarks/results/capability_map.json. De router leest dit bij elke prompt, dus wijzigingen werken direct door bij de volgende request.

Gap-analyse

Na een volledige run, kijk waar je stack gaten heeft:

python -m benchmarks --gaps

Output lijst categorieën waar geen model boven 0.7 scoort en suggereert modellen om te installeren.

Historie

python -m benchmarks --history

Toont eerdere runs, handig om regressies na een model-upgrade te vangen.

Benchmarks laden en lossen modellen, wat hoge RAM-druk betekent. Op 16 GB Apple Silicon, ga ervan uit dat de machine effectief niet beschikbaar is tijdens een volledige sweep.