De capability map
Soriku vertrouwt marketing-benchmarks niet. De capability map is een gemeten scorekaart per model en per categorie, gebouwd op jouw hardware zodat de router echte cijfers heeft om mee te werken.
Wat het is
Een JSON-bestand op benchmarks/results/capability_map.json dat vastlegt hoe elk geïnstalleerd model scoort per capability-categorie. Categorieën die ertoe doen: code generatie, code review, reasoning, samenvatten, vertaling, creatief schrijven, instruction following, multilingual, tool use.
De router leest dit bestand bij elke prompt om te beslissen welk model de beste fit is voor de taak. Geen marketingcijfers, geen externe leaderboard, alleen metingen op jouw eigen hardware.
Hoe het opgebouwd wordt
Elke categorie heeft een dataset met testprompts en referentieantwoorden in benchmarks/datasets/<categorie>.json. De runner stuurt elke prompt naar het model, vangt de respons op en scoort die tegen de referentie met een multi-judge aanpak. Het gemiddelde per categorie wordt de score.
Scoring
Test-scores lopen van 0.0 (fail) tot 1.0 (pass). Categoriescores zijn het gemiddelde over de dataset, gewogen door judge-consensus. Twee metrics reizen met elke score mee: confidence en source.
| Veld | Type | Betekenis |
|---|---|---|
score | 0.0–1.0 | Aggregaatkwaliteit voor dit model in deze categorie |
confidence | high | low | high = lokaal gemeten, low = bootstrap uit publieke priors |
source | benchmark | bootstrap | Waar de score vandaan komt |
entries_run | integer | Hoeveel testcases daadwerkelijk geëvalueerd zijn |
avg_latency_ms | integer | Gemiddelde responstijd tijdens de benchmark |
tokens_per_second | float | Gemeten throughput tijdens de run |
timestamp | ISO 8601 | Wanneer deze categorie laatst gebenchmarkt is voor dit model |
Bootstrap vs benchmark
Een verse install kan direct routeren omdat elk bekend model bootstrap-scores heeft uit publieke evaluaties. Die staan op confidence: low zodat je weet dat het priors zijn, geen metingen. Wanneer je de benchmark lokaal draait worden de waarden vervangen door confidence: high.
high-confidence scores wanneer beide bestaan voor hetzelfde model en categorie. Bootstrap vult gaten op, het overschrijft jouw metingen niet.Voorbeeld-entry
Gap-analyse
Draai python -m benchmarks --gaps om capability-gaten in je stack te vinden. De output lijst categorieën waar geen geïnstalleerd model boven 0.7 scoort en suggereert welke modellen je kan installeren om ze te vullen.