v0.3.0 · Open source · Apache 2.0

OpenAI-совместимый APIдля Triton с vLLM backend

Подключайте OpenAI SDK, LiteLLM, LibreChat и внутренние AI-приложения к собственному inference-контуру — со structured outputs, мультимодальностью, hybrid embeddings и production-ограничениями.

Triton управляет моделями, vLLM — batching и генерацией. Gateway добавляет клиентский API, model-specific preprocessing и контроль запроса.

Что нового в v0.3.0

Независимый community-проект. Не является продуктом NVIDIA.

26.07NVIDIA Triton
0.24.0vLLM
208автотестов релиза
v0.3.0актуальный релиз

Зачем нужен gateway

Между модельным runtime и AI-приложением не хватает продуктового слоя

Gateway сохраняет inference внутри Triton/vLLM, но берёт на себя клиентский протокол, мультимодальные входы, контроль ресурсов и наблюдаемость.

01Compatibility

Один контракт для разных клиентов

Знакомые /v1 endpoint-ы для OpenAI SDK, LiteLLM, LibreChat и внутренних сервисов.

02Orchestration

Сложные входы без клиентского хаоса

Изображения, видео, аудио и PDF проходят контролируемую предобработку и маршрутизацию.

03Control

Контроль перегрузки inference

Очереди и лимиты внутри gateway pod, отмена и HTTP 429 защищают runtime; TLS, auth и tenant quotas остаются на внешнем proxy.

Выбор архитектуры

Когда нужен именно Triton OpenAI Gateway

Это не универсальный multi-provider proxy. Gateway нужен, когда Triton должен остаться основным runtime, а продуктовым клиентам требуется знакомый контракт и model-specific orchestration.

01Модельный API

Direct Triton

Выбирайте, если клиент уже умеет работать с Triton API, repository и tensor contract.

02Один runtime

Direct vLLM

Подходит для чистого vLLM endpoint, когда стандартного OpenAI server достаточно.

03Multi-provider routing

LiteLLM

Маршрутизирует провайдеры и модели; при необходимости может располагаться уровнем выше gateway.

04Control layer

Triton Gateway

Сохраняет Triton и добавляет OpenAI-клиентов, media, context/reasoning policies, admission и telemetry.

ПодходитTriton уже используется; нужны OpenAI SDK, LibreChat или LiteLLM; в одном контуре работают chat, structured outputs, hybrid embeddings, rerank и multimodal модели.

Может быть лишнимНужен hosted API без собственной GPU-инфраструктуры, универсальный routing между SaaS-провайдерами или только один стандартный vLLM endpoint.

Релиз v0.3.0 · 25 августа 2026

Structured outputs и hybrid retrieval в том же inference-контуре

Существующие chat, embeddings, rerank и multimodal endpoint-ы остаются обратно совместимыми. Hybrid embeddings — опциональное расширение gateway.

01

Structured outputs

OpenAI response_format поддерживает json_object и строгий JSON Schema output.

02

Deterministic chat

Параметр seed, нормализованные system messages и корректный finish_reason=length.

03

Rerank micro-batching

Ограниченные последовательные micro-batch уменьшают риск CUDA OOM и сохраняют порядок документов.

04

Hybrid embeddings

BGE-M3 возвращает dense и lexical sparse vectors через native vLLM pooling или Python fallback.

Defaults v0.3.0reasoningdisabledcontexttruncatereranktop_n

Коротко об архитектуре

Gateway соединяет приложения с runtime — не заменяя его

Authentication и TLS остаются на внешнем proxy. Gateway управляет запросом, Triton — жизненным циклом моделей, vLLM — выполнением и batching.

Открыть полную схему
request & trust flow
AI-клиентыSDK · LiteLLM · LibreChat
Auth proxyTLS · auth · tenant quotas
Gatewayprotocol · context · media
Triton + vLLMmodels · scheduling · inference

Изучить подробнее

От API-контракта до production-развёртывания

Проверьте поддерживаемые сценарии, разберите путь запроса и подготовьте пилот в своём контуре.

Open source · Apache 2.0

Проверьте gateway на одной некритичной модели

Пилот должен подтвердить OpenAI SDK, JSON Schema output, hybrid retrieval, управляемый 429 и наблюдаемость на вашей GPU-топологии.