Performance
Lokale AI hoort niet traag aan te voelen. Wanneer het wel zo is, is de oorzaak meestal één van drie dingen: GPU niet ingeschakeld, model te groot, of het verkeerde model geladen.
1. GPU ingeschakeld?
Op Apple Silicon, check dat Ollama Metal gebruikt: ollama serve logs using Metal. Als je falling back to CPU ziet, heb je een Ollama-versie die je machine niet ondersteunt, of een driver-issue. Update Ollama.
2. Juiste model-grootte?
Een 70B-model op 16 GB RAM swapt naar disk en kruipt. Houd het op 7B voor routine-werk, grijp pas naar groter als je het echt nodig hebt. Zie benchmarks/results/capability_map.json om kleinere modellen te vinden die goed genoeg scoren op je taak.
3. Verkeerd model geladen?
Eerste request na een routing-wijziging betaalt de model-load kost (5-10 seconden typisch). Volgende requests zijn snel. Als je modellen swapt bij elke request, verhoog keep_alive_seconds in de hardware-config.