docs / troubleshooting / performance

Performance

Lokale AI hoort niet traag aan te voelen. Wanneer het wel zo is, is de oorzaak meestal één van drie dingen: GPU niet ingeschakeld, model te groot, of het verkeerde model geladen.

1. GPU ingeschakeld?

Op Apple Silicon, check dat Ollama Metal gebruikt: ollama serve logs using Metal. Als je falling back to CPU ziet, heb je een Ollama-versie die je machine niet ondersteunt, of een driver-issue. Update Ollama.

2. Juiste model-grootte?

Een 70B-model op 16 GB RAM swapt naar disk en kruipt. Houd het op 7B voor routine-werk, grijp pas naar groter als je het echt nodig hebt. Zie benchmarks/results/capability_map.json om kleinere modellen te vinden die goed genoeg scoren op je taak.

3. Verkeerd model geladen?

Eerste request na een routing-wijziging betaalt de model-load kost (5-10 seconden typisch). Volgende requests zijn snel. Als je modellen swapt bij elke request, verhoog keep_alive_seconds in de hardware-config.

Meet het

# tokens/seconde uit de meest recente benchmark
jq '.models | to_entries[] | {model: .key, tps: [.value | to_entries[].value.tokens_per_second]}' benchmarks/results/capability_map.json