Benchmarks draaien
Meet je modellen op jouw hardware zodat de router echte cijfers heeft. Vijf commando's, twee smaken, één JSON-output die de router automatisch oppikt.
Twee modes
| Mode | Commando | Tijd per model | Wanneer |
|---|---|---|---|
| Quick | python -m benchmarks --quick | ~4 minuten | Na eerste install, na pullen van een nieuw model |
| Full | python -m benchmarks | ~15 minuten | Voordat je op routing leunt voor belangrijke workloads |
Gerichte runs
# één model, alle categorieën
python -m benchmarks --model qwen2.5-coder:7b
# één categorie, alle geïnstalleerde modellen
python -m benchmarks --category reasoning
# combineer
python -m benchmarks --model deepseek-r1:7b --category code_generation
Waar resultaten landen
Resultaten gaan naar benchmarks/results/capability_map.json. De router leest dit bij elke prompt, dus wijzigingen werken direct door bij de volgende request.
Gap-analyse
Na een volledige run, kijk waar je stack gaten heeft:
python -m benchmarks --gaps
Output lijst categorieën waar geen model boven 0.7 scoort en suggereert modellen om te installeren.
Historie
python -m benchmarks --history
Toont eerdere runs, handig om regressies na een model-upgrade te vangen.
Benchmarks laden en lossen modellen, wat hoge RAM-druk betekent. Op 16 GB Apple Silicon, ga ervan uit dat de machine effectief niet beschikbaar is tijdens een volledige sweep.