← Линейка продуктов 009 · ИИ-инфраструктура для разных моделей Разработка

Подбирает модель под каждый запрос.

AI-инфраструктура для разных моделей

Слой маршрутизации решает, куда отправить каждый запрос: в Claude, GPT, Qwen, Nemotron, Gemma или модель на твоём сервере. Он проверяет качество, считает стоимость и следит за квотами. Если один сервис падает, запрос уходит в другой.

Категория
Инфраструктура
Интерфейс
Совместимо с OpenAI
Ядро
NIM · TensorRT-LLM
Статус
Разработка
ModelMesh AI, где применять

Проблема

Зависеть от одной модели дорого и рискованно.

Привязывая продукт к модели одного поставщика, ты принимаешь его цену, квоты и сбои. Цена растёт, и маржа падает. Квота заканчивается, и пользователь видит ошибку. Сервис поставщика падает, а вместе с ним и твой продукт.

И не каждая задача заслуживает одну и ту же модель. Запускать самую дорогую модель ради краткого пересказа письма всё равно что арендовать экскаватор, чтобы забить гвоздь.

Зависеть от одной модели дорого и рискованно.

Что делает

Система оценивает каждый запрос и выбирает подходящую модель. Качество сохраняется, счёт уменьшается.

01

Выбор модели

Выбирает по типу задачи: короткая классификация идёт в локальную модель, сложное рассуждение в большую.

02

Расчёт стоимости

Считает стоимость каждого запроса по токенам. Сумма месячного счёта известна заранее.

03

Управление квотами

Система следит за лимитами провайдеров и заранее перераспределяет трафик.

04

Передаёт автоматически

Если сервис тормозит или падает, запрос за секунды уходит на запасной. Пользователь ничего не замечает.

05

Замер

Система постоянно измеряет задержку, точность и стоимость. По этим данным она меняет маршрутизацию.

06

Граница данных

Запрос с конфиденциальными данными не покидает сервер. Он уходит в модель, развёрнутую у тебя.

Для кого

Для команд, которые не хотят зависеть от одного провайдера.

Продуктовые команды на одном провайдере

Для сервисов, где товар встаёт при смене цены, заполненной квоте или сбое внешнего сервиса.

Компании, у которых скачет стоимость моделей

Для команд, которые узнают сумму счёта в конце месяца и не видят расходы по функциям.

Данные, часть которых нельзя выпускать наружу

Для компаний, у которых часть запросов не должна уходить наружу, но держать всё на своих серверах они не могут.

Демо вживую

Пример запуска · не на реальных данных

Одна задача, шесть моделей
  • Nemotron·
  • Claude·
  • GPT·
  • Qwen·
  • Gemma · локально·

Демо-запуск · реальные замеры сделаем по запросу

Как это работает

Четыре шага.

01

Задать

Ты задаёшь, какие модели можно подключать и какие данные не выйдут наружу.

02

Перенаправить

Каждый запрос оценивается по качеству, задержке и стоимости. Система выбирает модель с лучшим результатом.

03

Смотри

Система постоянно измеряет результаты. Если модель сдаёт, её рейтинг и трафик снижаются.

04

Передать

При сбое маршрут меняется автоматически. В коде приложения не придётся менять ни строчки.

Технологии

На чём это собрано.

  • NVIDIA NIM
  • TensorRT-LLM
  • Nemotron
  • Go
  • Redis
  • API, совместимый с OpenAI

Локальные модели упаковываем как микросервисы NVIDIA NIM и ускоряем через TensorRT-LLM. Одна модель работает в облаке и в твоём дата-центре через тот же интерфейс. Роутер написан на Go, метрики и квоты храним в Redis.

Изображения

Маршрут · оптический аналог
Маршрут · оптический аналог
Слой подключения
Слой подключения
Дата-центр
Дата-центр

Частые вопросы

Что стоит узнать до созвона.

Нужно ли менять наш код?

Нет. Интерфейс совместим с OpenAI, тебе достаточно поменять адрес в текущих вызовах.

Как узнать, какая модель обработала запрос?

Мы записываем каждый запрос: модель, время обработки, стоимость и причину выбора. В панели всё видно построчно.

Что будет, если провайдер упадёт?

Запрос передаётся следующей подходящей модели. Передача пишется в журнал, не прячется, поэтому потом ты можешь замерить разницу в качестве.

Можно запретить передачу отдельных данных наружу?

Да. Ты задаёшь правило: этот тип контента отправлять только в модель на нашем сервере. Нарушить правило нельзя, маршрутизатор даже не предлагает внешний вариант.

Можно купить уже сейчас?

Нет, пока разрабатываем. Список раннего доступа открыт.

Контакты

Что-то похожее?
хочешь заказать?

Опиши задачу одной фразой. Мы скажем, что нужно и сколько времени займёт.