Lokaal-eerst
Lokaal-eerst is geen marketinghouding, het is een ontwerp-constraint. De standaardtoestand van Soriku is offline. Cloud is opt-in, per prompt en per model.
Wat lokaal-eerst praktisch betekent
- Inference kan volledig op je machine draaien via Ollama. Geen internet nodig na de initiële model-pull.
- Agent-geheugen, capability map, routing-logs, persona-definities leven allemaal in
data/op je machine. Niets wordt naar een server gestuurd. - API-keys voor externe providers leven in
data/keystore.json, versleuteld met een lokale sleutel. Worden ontsleuteld op request-tijd, gebruikt, en uit het geheugen gehaald. - Cloud is opt-in per prompt: zelfs als je externe providers geconfigureerd hebt, kiest elke routing-beslissing nog steeds lokaal wanneer lokaal goed genoeg is.
Waarom het ertoe doet
- Privacy: je prompts verlaten je machine niet, tenzij je ze expliciet eruit routeert.
- Compliance: lokaal-eerst maakt van de EU AI Act een standaard-toestand in plaats van een configuratie-hoofdpijn. Zie EU AI Act.
- Kosten: lokale inference heeft nul per-token kosten na de install. Je betaalt in elektriciteit en hardware, niet in API-fees.
- Veerkracht: Soriku blijft werken wanneer je internet uitvalt, wanneer een API-provider down is, of wanneer een model gedeprecieerd wordt.
- Geen vendor lock-in: je kan providers wisselen, de engine forken, of hem op andere hardware draaien zonder je setup te verliezen.
Wanneer de cloud wél zin heeft
Lokaal-eerst betekent niet lokaal-alleen. Voor specifieke taken zijn externe providers duidelijk beter: zware reasoning met Claude Opus, long-context summarisation met Gemini, ultra-snelle inference met Groq. Soriku routeert naar ze wanneer de capability map zegt dat ze winnen, en alleen wanneer je constraints het toelaten.