← Productlijn 009 · Slimme AI-infra voor meerdere modellen Bouw

Kiest voor elke aanvraag het juiste model.

Slimme AI-infrastructuur voor meerdere modellen

Een routeringslaag kiest per aanvraag tussen Claude, GPT, Qwen, Nemotron, Gemma en modellen op je eigen server. Hij meet de kwaliteit, berekent de kosten en bewaakt quota. Valt een dienst uit, dan schakelt hij over.

Categorie
Infrastructuur
Interface
Werkt met OpenAI
Kern
NIM · TensorRT-LLM
Status
Bouw
ModelMesh AI, gebruikssituatie

Probleem

Eén model maakt je duur en kwetsbaar.

Koppel je een product aan het model van één leverancier, dan accepteer je zijn prijs, quotum en storingen. Stijgt de prijs, dan verdwijnt je marge. Is het quotum op, dan krijgt de gebruiker een foutmelding. Valt de dienst uit, dan valt je product ook uit.

Niet elke taak verdient hetzelfde model. Het duurste model inzetten om één e-mail samen te vatten is als een graafmachine huren om een spijker in te slaan.

Eén model maakt je duur en kwetsbaar.

Wat doet het

Elk verzoek beoordelen we apart en we kiezen het model dat het best bij die taak past. De kwaliteit blijft staan, de factuur daalt.

01

Modelkeuze

Het systeem kiest op basis van de taak: een korte classificatie gaat naar het lokale model, complex redeneerwerk naar het grote model.

02

Kostenberekening

Houdt per aanvraag de kosten in tokens bij. Geen verrassingen op de maandfactuur.

03

Quotabeheer

Houdt limieten van aanbieders bij en verdeelt verkeer voordat ze worden bereikt.

04

Automatisch doorzetten

Wordt een service traag of valt hij uit, dan gaan verzoeken binnen seconden naar een alternatief. De gebruiker merkt niets.

05

Meting

We meten steeds de vertraging, nauwkeurigheid en kosten. Die cijfers bepalen de routering.

06

Datalimiet

Een aanvraag met gevoelige data verlaat je server nooit. Die gaat naar het model op je eigen server.

Voor wie

Teams die niet aan één leverancier vast willen zitten.

Productteams die aan één aanbieder vastzitten

Voor systemen die stilvallen bij een prijswijziging, volle quota of een storing.

Bedrijven die modelkosten niet kunnen voorspellen

Teams die elke maand schrikken van de factuur en niet weten hoeveel elke functie verbruikt.

Data die deels intern moet blijven

Voor organisaties waar sommige verzoeken binnen moeten blijven, maar die niet alles op eigen servers kunnen draaien.

Live demo

Voorbeeldrun · niet met echte data

Dezelfde taak, zes modellen
  • Nemotron·
  • Claude·
  • GPT·
  • Qwen·
  • Gemma · lokaal·

Voorbeeld · echte metingen starten bij je aanvraag

Zo werkt het

Vier stappen.

01

Definieer

Jij bepaalt welke modellen je gebruikt en welke data niet naar buiten mag.

02

Stuur door

Het systeem beoordeelt elke aanvraag op kwaliteit, vertraging en kosten. Het beste model wint.

03

Kijk

We meten de resultaten continu. Presteert een model slechter, dan daalt de score en krijgt het minder verkeer.

04

Draag over

Bij een storing schakelt de routering vanzelf om. In de app wijzigt geen regel code.

Techniek

Waar het op draait.

  • NVIDIA NIM
  • TensorRT-LLM
  • Nemotron
  • Go
  • Redis
  • OpenAI-compatibele API

We verpakken lokale modellen als NVIDIA NIM-microservices en versnellen ze met TensorRT-LLM. Hetzelfde model draait in de cloud en in je eigen datacenter via dezelfde API. De router is in Go geschreven. Metingen en quota staan in Redis.

Beelden

Verwijzing · optische tegenhanger
Verwijzing · optische tegenhanger
Koppelingslaag
Koppelingslaag
Datacenter
Datacenter

Veelgestelde vragen

Wat je voor ons gesprek wilt weten.

Moeten we onze code aanpassen?

Nee. Je krijgt een OpenAI-compatibele interface. Je hoeft alleen het adres van je bestaande calls te wijzigen.

Hoe zien we welk model wordt gebruikt?

We loggen elke aanvraag: welk model, hoe lang het duurde, wat het kostte en waarom dat model draaide. In het paneel zie je alles per regel.

Wat gebeurt er als een aanbieder uitvalt?

Het verzoek gaat naar het eerstvolgende beschikbare model. We registreren die overdracht. Zo kun je het kwaliteitsverschil later meten.

Kunnen we voorkomen dat bepaalde data naar buiten gaat?

Ja. Je stelt een regel in: dit type content mag alleen naar het model op onze eigen server. Die regel kan niet worden omzeild. De router stuurt het verzoek nooit naar buiten.

Kun je het nu kopen?

Nee, we bouwen er nog aan. De lijst voor vroege toegang is open.

Contact

Iets vergelijkbaars?
wil je laten maken?

Leg het in één zin uit. Dan zeggen wij wat nodig is en hoe lang het duurt.