Modelkeuze
Het systeem kiest op basis van de taak: een korte classificatie gaat naar het lokale model, complex redeneerwerk naar het grote model.
Slimme AI-infrastructuur voor meerdere modellen
Een routeringslaag kiest per aanvraag tussen Claude, GPT, Qwen, Nemotron, Gemma en modellen op je eigen server. Hij meet de kwaliteit, berekent de kosten en bewaakt quota. Valt een dienst uit, dan schakelt hij over.
Probleem
Koppel je een product aan het model van één leverancier, dan accepteer je zijn prijs, quotum en storingen. Stijgt de prijs, dan verdwijnt je marge. Is het quotum op, dan krijgt de gebruiker een foutmelding. Valt de dienst uit, dan valt je product ook uit.
Niet elke taak verdient hetzelfde model. Het duurste model inzetten om één e-mail samen te vatten is als een graafmachine huren om een spijker in te slaan.

Wat doet het
Het systeem kiest op basis van de taak: een korte classificatie gaat naar het lokale model, complex redeneerwerk naar het grote model.
Houdt per aanvraag de kosten in tokens bij. Geen verrassingen op de maandfactuur.
Houdt limieten van aanbieders bij en verdeelt verkeer voordat ze worden bereikt.
Wordt een service traag of valt hij uit, dan gaan verzoeken binnen seconden naar een alternatief. De gebruiker merkt niets.
We meten steeds de vertraging, nauwkeurigheid en kosten. Die cijfers bepalen de routering.
Een aanvraag met gevoelige data verlaat je server nooit. Die gaat naar het model op je eigen server.
Voor wie
Voor systemen die stilvallen bij een prijswijziging, volle quota of een storing.
Teams die elke maand schrikken van de factuur en niet weten hoeveel elke functie verbruikt.
Voor organisaties waar sommige verzoeken binnen moeten blijven, maar die niet alles op eigen servers kunnen draaien.
Voorbeeldrun · niet met echte data
Zo werkt het
Jij bepaalt welke modellen je gebruikt en welke data niet naar buiten mag.
Het systeem beoordeelt elke aanvraag op kwaliteit, vertraging en kosten. Het beste model wint.
We meten de resultaten continu. Presteert een model slechter, dan daalt de score en krijgt het minder verkeer.
Bij een storing schakelt de routering vanzelf om. In de app wijzigt geen regel code.
Techniek
We verpakken lokale modellen als NVIDIA NIM-microservices en versnellen ze met TensorRT-LLM. Hetzelfde model draait in de cloud en in je eigen datacenter via dezelfde API. De router is in Go geschreven. Metingen en quota staan in Redis.
Beelden



Veelgestelde vragen
Nee. Je krijgt een OpenAI-compatibele interface. Je hoeft alleen het adres van je bestaande calls te wijzigen.
We loggen elke aanvraag: welk model, hoe lang het duurde, wat het kostte en waarom dat model draaide. In het paneel zie je alles per regel.
Het verzoek gaat naar het eerstvolgende beschikbare model. We registreren die overdracht. Zo kun je het kwaliteitsverschil later meten.
Ja. Je stelt een regel in: dit type content mag alleen naar het model op onze eigen server. Die regel kan niet worden omzeild. De router stuurt het verzoek nooit naar buiten.
Nee, we bouwen er nog aan. De lijst voor vroege toegang is open.
Contact
Leg het in één zin uit. Dan zeggen wij wat nodig is en hoe lang het duurt.