Wat is AI-orchestration?
AI-orchestration is de laag die bepaalt welk model welke taak doet, hem uitvoert, en het antwoord terugbrengt. Je kiest niet langer met de hand een model voor elke prompt, maar laat een systeem kiezen op gemeten data.
Het probleem dat het oplost
Zodra je meer dan één model hebt, moet je bij elke prompt een keuze maken. Het snelle lokale of het sterke externe. De coder of de generalist. De meeste mensen beantwoorden die vraag met een gewoonte, en die gewoonte zit er soms naast. Orchestration maakt van die gok een gemeten keuze.
Hoe het werkt
Een orchestrator houdt een beeld bij van waar elk model goed in is, classificeert de binnenkomende taak, en routeert hem naar het model dat het hoogst scoort voor dat soort werk, binnen de grenzen die jij stelt. De goede laten je zien wie antwoordde en waarom, zodat je de beslissing kan nakijken in plaats van vertrouwen.
In Soriku is dat beeld de capability map, gebouwd door je modellen op je eigen hardware te benchmarken. Routing leest de map en dispatcht per taak. Het detail staat in de docs over de capability map en smart routing.
Lokaal en extern, één laag
Orchestration is op z’n nuttigst als het een model op je laptop en een model in een datacenter gelijk behandelt: als kandidaten op dezelfde schaal gescoord. Zo houd je het goedkope, private, lokale werk lokaal, en grijp je alleen naar de cloud als een taak dat verdient.
Vragen over orchestration
Wat is AI-orchestration?
Het is de laag die bepaalt welk AI-model een taak doet, hem uitvoert, en het resultaat teruggeeft. In plaats van met de hand een model te kiezen voor elke prompt, routeert een orchestrator elke taak naar de beste keuze op basis van gemeten capability en jouw randvoorwaarden.
Heb ik orchestration nodig als ik maar één model gebruik?
Minder. Orchestration verdient zich terug zodra je een mix hebt, een snel lokaal model en een sterk extern, of meerdere gespecialiseerde modellen. Met één model is er niets te routeren.
Is AI-orchestration hetzelfde als een AI-gateway?
Nee. Een gateway stuurt je request door naar een provider die je al koos. Een orchestrator maakt die keuze voor je, op capability en kosten, en kan de taak op een lokaal model draaien zodat hij je machine niet verlaat.
Voegt orchestration latency toe?
Soriku classificeert een prompt in onder de vijf milliseconden en routeert vanuit een vooraf berekende map, dus de routing-beslissing is praktisch gratis vergeleken met de model-call zelf.