Wybór modelu
System dobiera model do zadania. Prostą klasyfikację kieruje do modelu lokalnego, a złożone rozumowanie do dużego modelu.
Inteligentna infrastruktura AI dla wielu modeli
Warstwa routingu, która dla każdego żądania wybiera między Claude, GPT, Qwen, Nemotron, Gemma a modelami na twoim serwerze. Mierzy jakość, liczy koszt, pilnuje limitów i przełącza usługę po awarii.
Problem
Gdy uzależniasz produkt od modelu jednego dostawcy, godzisz się na trzy rzeczy: jego cenę, limit i awarie. Gdy cena rośnie, tracisz marżę. Gdy wyczerpie się limit, użytkownik widzi błąd. Gdy usługa pada, razem z nią pada twój produkt.
Nie każde zadanie wymaga tego samego modelu. Uruchamiać najdroższy model, żeby streścił e-mail, to jak wynająć koparkę do wbicia gwoździa.

Co robi
System dobiera model do zadania. Prostą klasyfikację kieruje do modelu lokalnego, a złożone rozumowanie do dużego modelu.
System zapisuje koszt każdego żądania w tokenach. Miesięczna faktura cię nie zaskoczy.
System śledzi limity dostawców. Gdy wykorzystanie zbliża się do granicy, z wyprzedzeniem rozdziela ruch.
Gdy jedna usługa zwalnia albo pada, żądanie w kilka sekund trafia do alternatywy. Użytkownik tego nie widzi.
Stale mierzymy opóźnienie, trafność i koszt. Na tej podstawie system kieruje kolejne żądania.
Żądanie z danymi wrażliwymi nigdy nie opuszcza twojej infrastruktury. System kieruje je do modelu na twoim serwerze.
Dla kogo
Produkty, które stają, gdy zmienia się cena, kończy limit albo pada serwis.
Zespoły, które pod koniec miesiąca zaskakuje faktura i nie wiedzą, ile kosztuje każda funkcja.
Dla firm, które muszą trzymać część zapytań u siebie, choć nie uruchomią wszystkiego na własnym serwerze.
Przykładowe uruchomienie · bez prawdziwych danych
Jak to działa
Ty decydujesz, których modeli używasz i jakie dane zostają u ciebie.
System ocenia każde żądanie pod kątem jakości, opóźnienia i kosztu. Potem wybiera model z najlepszym wynikiem.
Stale mierzymy wyniki. Gdy model działa gorzej, obniżamy jego ocenę i kierujemy do niego mniej ruchu.
Gdy usługa przestaje działać, system automatycznie przekierowuje żądania. Nie zmieniasz ani jednej linii kodu w aplikacji.
Technologia
Pakujemy modele lokalne jako mikroserwisy NVIDIA NIM i przyspieszamy je przez TensorRT-LLM. Ten sam model działa w chmurze i we własnym centrum danych przez ten sam interfejs. Router napisaliśmy w Go, a pomiary i stan limitów trzymamy w Redis.
Grafiki



Częste pytania
Nie. Dostajesz interfejs zgodny z OpenAI, więc wystarczy zmienić adres obecnych wywołań.
Zapisujemy każde zapytanie: model, czas, koszt i powód wyboru. W panelu widzisz wszystko wiersz po wierszu.
System przekazuje żądanie do kolejnego dostępnego modelu i zapisuje tę zmianę. Niczego nie ukrywa, więc później zmierzysz różnicę jakości.
Tak. Ustalasz regułę: ten typ treści trafia wyłącznie do modelu na naszym serwerze. System nie pozwala jej ominąć, a router nigdy nie wysyła takiego żądania na zewnątrz.
Nie, wciąż budujemy produkt. Przyjmujemy zapisy na wczesny dostęp.
Kontakt
Opisz to jednym zdaniem. My powiemy, czego trzeba i ile to zajmie.