docs / concepts / capability-map

De capability map

Soriku vertrouwt marketing-benchmarks niet. De capability map is een gemeten scorekaart per model en per categorie, gebouwd op jouw hardware zodat de router echte cijfers heeft om mee te werken.

Wat het is

Een JSON-bestand op benchmarks/results/capability_map.json dat vastlegt hoe elk geïnstalleerd model scoort per capability-categorie. Categorieën die ertoe doen: code generatie, code review, reasoning, samenvatten, vertaling, creatief schrijven, instruction following, multilingual, tool use.

De router leest dit bestand bij elke prompt om te beslissen welk model de beste fit is voor de taak. Geen marketingcijfers, geen externe leaderboard, alleen metingen op jouw eigen hardware.

Hoe het opgebouwd wordt

Elke categorie heeft een dataset met testprompts en referentieantwoorden in benchmarks/datasets/<categorie>.json. De runner stuurt elke prompt naar het model, vangt de respons op en scoort die tegen de referentie met een multi-judge aanpak. Het gemiddelde per categorie wordt de score.

# volledige sweep over alle geïnstalleerde modellen
python -m benchmarks
# quick mode: 20% van de dataset
python -m benchmarks --quick
# één model
python -m benchmarks --model qwen2.5-coder:7b
# één categorie
python -m benchmarks --category reasoning

Scoring

Test-scores lopen van 0.0 (fail) tot 1.0 (pass). Categoriescores zijn het gemiddelde over de dataset, gewogen door judge-consensus. Twee metrics reizen met elke score mee: confidence en source.

VeldTypeBetekenis
score0.0–1.0Aggregaatkwaliteit voor dit model in deze categorie
confidencehigh | lowhigh = lokaal gemeten, low = bootstrap uit publieke priors
sourcebenchmark | bootstrapWaar de score vandaan komt
entries_runintegerHoeveel testcases daadwerkelijk geëvalueerd zijn
avg_latency_msintegerGemiddelde responstijd tijdens de benchmark
tokens_per_secondfloatGemeten throughput tijdens de run
timestampISO 8601Wanneer deze categorie laatst gebenchmarkt is voor dit model

Bootstrap vs benchmark

Een verse install kan direct routeren omdat elk bekend model bootstrap-scores heeft uit publieke evaluaties. Die staan op confidence: low zodat je weet dat het priors zijn, geen metingen. Wanneer je de benchmark lokaal draait worden de waarden vervangen door confidence: high.

De router prefereert high-confidence scores wanneer beide bestaan voor hetzelfde model en categorie. Bootstrap vult gaten op, het overschrijft jouw metingen niet.

Voorbeeld-entry

{
"models": {
"qwen2.5-coder:7b": {
"code_generation": {
"score": 0.812,
"confidence": "high",
"source": "benchmark",
"entries_run": 45,
"avg_latency_ms": 8420,
"tokens_per_second": 38.2,
"timestamp": "2026-05-23T15:03:16Z"
},
"reasoning": {
"score": 0.521,
"confidence": "low",
"source": "bootstrap"
}
}
}
}

Gap-analyse

Draai python -m benchmarks --gaps om capability-gaten in je stack te vinden. De output lijst categorieën waar geen geïnstalleerd model boven 0.7 scoort en suggereert welke modellen je kan installeren om ze te vullen.

Volgende: smart routing →