Model seçimi
İşin türüne göre karar verir: kısa sınıflandırma yerel modele, karmaşık akıl yürütme büyük modele gider.
Intelligent Multi-Model AI Infrastructure
Claude, GPT, Qwen, Nemotron, Gemma ve kendi sunucundaki modeller arasında istek bazında karar veren bir yönlendirme katmanı. Kaliteyi ölçer, maliyeti hesaplar, kotayı yönetir, bir servis çökerse diğerine geçer.
Sorun
Bir ürünü tek bir sağlayıcının modeline bağladığında üç şeyi birden kabul etmiş olursun: onun fiyatını, onun kotasını ve onun kesintisini. Fiyat arttığında ürünün marjı gider, kota dolduğunda kullanıcı hata görür, servis çöktüğünde ürünün de çöker.
Üstelik her iş aynı modeli hak etmez. Bir e-postayı özetlemek için en pahalı modeli çalıştırmak, çivi çakmak için kepçe kiralamaktır.

Ne yapıyor
İşin türüne göre karar verir: kısa sınıflandırma yerel modele, karmaşık akıl yürütme büyük modele gider.
Her isteğin kaça mal olduğunu jeton bazında tutar. Aylık fatura sürpriz olmaz.
Sağlayıcı limitlerini takip eder, sınıra yaklaşınca trafiği önceden dağıtır.
Bir servis yavaşlar veya çökerse istek saniyeler içinde alternatife gider; kullanıcı fark etmez.
Gecikme, doğruluk ve maliyet sürekli ölçülür. Yönlendirme kararı bu ölçümlerle güncellenir.
Hassas veri içeren istek hiçbir koşulda dışarı çıkmaz. Kendi sunucundaki modele yönlendirilir.
Kimler için
Fiyat değiştiğinde, kota dolduğunda ya da servis kesildiğinde ürünü duran yapılar.
Fatura ay sonunda sürpriz olan, hangi özelliğin ne kadar tükettiğini bilmeyen ekipler.
Bazı isteklerin dışarı hiç çıkmaması gereken, ama her şeyi kendi sunucusunda çalıştıramayan kurumlar.
Örnek çalıştırma · gerçek veriyle değil
Nasıl çalışır
Hangi modellerin kullanılabileceğini ve hangi verinin dışarı çıkamayacağını sen belirlersin.
Gelen her istek kalite, gecikme ve maliyet ekseninde puanlanır. Kazanan model seçilir.
Sonuçlar sürekli ölçülür. Bir model kötüleşirse puanı düşer, trafiği azalır.
Kesinti anında yönlendirme otomatik değişir. Uygulama tarafında tek satır kod değişmez.
Teknoloji
Yerel modeller NVIDIA NIM mikroservisleri olarak paketlenip TensorRT-LLM ile hızlandırılıyor; aynı model hem bulutta hem kendi veri merkezinde aynı arayüzle çalışıyor. Yönlendirici Go ile yazıldı, ölçüm ve kota durumu Redis üzerinde tutuluyor.
Görseller



Sık sorulanlar
Hayır. OpenAI uyumlu arayüz veriyor, mevcut çağrılarınızın adresini değiştirmeniz yeterli.
Her istek kaydediliyor: hangi model, ne kadar sürdü, ne kadar tuttu, neden o model seçildi. Panelde satır satır görünüyor.
İstek sıradaki uygun modele devrediliyor. Devretme kaydediliyor, sessizce yapılmıyor, böylece kalite farkını sonradan ölçebiliyorsunuz.
Evet. Kural yazıyorsunuz: şu içerik tipi yalnız kendi sunucumuzdaki modele gitsin. Kural ihlal edilemiyor, yönlendirici o isteği dışarıya hiç önermiyor.
Hayır, geliştirme aşamasında. Erken erişim listesi açık.
İletişim
Bir cümleyle anlat. Ne gerektiğini ve ne kadar süreceğini biz söyleyelim.