Mei 2026
Benchmark

Wat 240 benchmarks van lokale modellen zeggen

We draaiden dezelfde evaluatie van zestien categorieën over vijf modellen, qwen2.5-coder, deepseek-r1, gemma3, phi4-mini en de qwen3-familie, op drie Apple Silicon-machines die we precies voor dit soort testen achter de hand houden. Vermenigvuldig dat en je komt op 240 losse runs, vandaar het getal in de titel. Wat eruit kwam zei minder over welk model het beste is en meer over hoeveel jouw eigen hardware bepaalt.

De drie machines: een basis M1 met 16GB unified memory, een M2 Pro met 32GB, en een M4 Max met 64GB. Dezelfde prompts, dezelfde scoring, dezelfde zestien categorieën, één keer gedraaid per model per machine. De enige variabele die we bewust veranderden was de hardware eronder.

De scores bewegen meer dan de modellen

De code-generatiescore van qwen2.5-coder op de M1 ligt merkbaar lager dan datzelfde model op de M4 Max. Niet omdat de gewichten veranderden. Quantisatie, beschikbaar RAM, en hoeveel de machine throttelt tijdens een lange run verschuiven het getal, en ze verschuiven het meer dan het verschil tussen twee verschillende modellen op dezelfde machine. deepseek-r1 laat hetzelfde patroon zien in reasoning, gemma3 in vertaling.

De rangorde verschuift ook. Een model dat voorop loopt op de ene machine zakt terug op een andere, in dezelfde categorie. Op de M1 wisselen phi4-mini en gemma3 van plek in samenvatten, afhankelijk van hoeveel geheugendruk de rest van het systeem op dat moment heeft. Dat is geen ruis die we eruit filterden. Het is precies waar het om gaat.

Een gepubliceerde score is een momentopname van andermans machine

Publieke leaderboards draaien één keer, op één machine, en publiceren één getal per model per categorie. Dat getal klopt, maar het beschrijft omstandigheden die jij niet deelt: andermans RAM, andermans quantisatiekeuzes, andermans thermisch plafond. Niets daarin vertelt je wat qwen2.5-coder scoort op de machine die voor je staat.

Daarom importeert Soriku geen publieke benchmarktabel en noemt het klaar. Wanneer je een model toevoegt, benchmarkt Soriku het op jouw hardware, in jouw zestien categorieën, en toont de spreiding naast de score. Een getal zonder zijn onzekerheid is een getal dat je nog niet kan vertrouwen.

De 240 runs achter dit artikel zijn onze eigen meting, op onze drie machines, geen claim over jouw setup. Zie de cijfers als illustratie van hoeveel hardware ertoe doet, niet als ranglijst om over te nemen. Draai de capability map op je eigen machine en de scores zien er anders uit, met opzet.

Wat we erdoor veranderden

We stopten met een categoriescore vertrouwen zonder ook de spreiding te lezen. Een strakke cluster van resultaten over drie testruns betekent iets anders dan drie runs die nergens bij elkaar in de buurt landden, ook als het gemiddelde identiek is. De capability map toont nu allebei, en een score met een brede spreiding geldt als voorlopig totdat hij opnieuw draait.

Niets hiervan maakt benchmarken makkelijker. Het brengt het getal dichter bij waar. Een score die alleen standhoudt op de machine die hem maakte was nooit echt een score, het was een gok met een komma erachter.

← Terug naar blog