Выбор модели
Выбирает по типу задачи: короткая классификация идёт в локальную модель, сложное рассуждение в большую.
AI-инфраструктура для разных моделей
Слой маршрутизации решает, куда отправить каждый запрос: в Claude, GPT, Qwen, Nemotron, Gemma или модель на твоём сервере. Он проверяет качество, считает стоимость и следит за квотами. Если один сервис падает, запрос уходит в другой.
Проблема
Привязывая продукт к модели одного поставщика, ты принимаешь его цену, квоты и сбои. Цена растёт, и маржа падает. Квота заканчивается, и пользователь видит ошибку. Сервис поставщика падает, а вместе с ним и твой продукт.
И не каждая задача заслуживает одну и ту же модель. Запускать самую дорогую модель ради краткого пересказа письма всё равно что арендовать экскаватор, чтобы забить гвоздь.

Что делает
Выбирает по типу задачи: короткая классификация идёт в локальную модель, сложное рассуждение в большую.
Считает стоимость каждого запроса по токенам. Сумма месячного счёта известна заранее.
Система следит за лимитами провайдеров и заранее перераспределяет трафик.
Если сервис тормозит или падает, запрос за секунды уходит на запасной. Пользователь ничего не замечает.
Система постоянно измеряет задержку, точность и стоимость. По этим данным она меняет маршрутизацию.
Запрос с конфиденциальными данными не покидает сервер. Он уходит в модель, развёрнутую у тебя.
Для кого
Для сервисов, где товар встаёт при смене цены, заполненной квоте или сбое внешнего сервиса.
Для команд, которые узнают сумму счёта в конце месяца и не видят расходы по функциям.
Для компаний, у которых часть запросов не должна уходить наружу, но держать всё на своих серверах они не могут.
Пример запуска · не на реальных данных
Как это работает
Ты задаёшь, какие модели можно подключать и какие данные не выйдут наружу.
Каждый запрос оценивается по качеству, задержке и стоимости. Система выбирает модель с лучшим результатом.
Система постоянно измеряет результаты. Если модель сдаёт, её рейтинг и трафик снижаются.
При сбое маршрут меняется автоматически. В коде приложения не придётся менять ни строчки.
Технологии
Локальные модели упаковываем как микросервисы NVIDIA NIM и ускоряем через TensorRT-LLM. Одна модель работает в облаке и в твоём дата-центре через тот же интерфейс. Роутер написан на Go, метрики и квоты храним в Redis.
Изображения



Частые вопросы
Нет. Интерфейс совместим с OpenAI, тебе достаточно поменять адрес в текущих вызовах.
Мы записываем каждый запрос: модель, время обработки, стоимость и причину выбора. В панели всё видно построчно.
Запрос передаётся следующей подходящей модели. Передача пишется в журнал, не прячется, поэтому потом ты можешь замерить разницу в качестве.
Да. Ты задаёшь правило: этот тип контента отправлять только в модель на нашем сервере. Нарушить правило нельзя, маршрутизатор даже не предлагает внешний вариант.
Нет, пока разрабатываем. Список раннего доступа открыт.
Контакты
Опиши задачу одной фразой. Мы скажем, что нужно и сколько времени займёт.