python -m benchmarks
Draai de capability-benchmark suite die de capability map opbouwt.
Synopsis
python -m benchmarks [opties]
Opties
| Flag | Effect |
|---|---|
--quick | Draai 20% van elke dataset, ~4 minuten per model |
--model | Benchmark een enkel model |
--category | Benchmark een enkele categorie |
--report | Toon laatste resultaten zonder opnieuw te draaien |
--gaps | Draai gap-analyse: waar ontbreekt capability? |
--history | Toon eerdere runs |
--reset-stale | Wis gedeeltelijke/inconsistente entries uit de map |