docs / cli / benchmarks

python -m benchmarks

Draai de capability-benchmark suite die de capability map opbouwt.

Synopsis

python -m benchmarks [opties]

Opties

FlagEffect
--quickDraai 20% van elke dataset, ~4 minuten per model
--modelBenchmark een enkel model
--categoryBenchmark een enkele categorie
--reportToon laatste resultaten zonder opnieuw te draaien
--gapsDraai gap-analyse: waar ontbreekt capability?
--historyToon eerdere runs
--reset-staleWis gedeeltelijke/inconsistente entries uit de map