Один контракт для разных клиентов
Знакомые /v1 endpoint-ы для OpenAI SDK, LiteLLM, LibreChat и внутренних сервисов.
v0.3.0 · Open source · Apache 2.0
Подключайте OpenAI SDK, LiteLLM, LibreChat и внутренние AI-приложения к собственному inference-контуру — со structured outputs, мультимодальностью, hybrid embeddings и production-ограничениями.
Triton управляет моделями, vLLM — batching и генерацией. Gateway добавляет клиентский API, model-specific preprocessing и контроль запроса.
Что нового в v0.3.0Независимый community-проект. Не является продуктом NVIDIA.
POST /v1/chat/completions200Зачем нужен gateway
Gateway сохраняет inference внутри Triton/vLLM, но берёт на себя клиентский протокол, мультимодальные входы, контроль ресурсов и наблюдаемость.
Знакомые /v1 endpoint-ы для OpenAI SDK, LiteLLM, LibreChat и внутренних сервисов.
Изображения, видео, аудио и PDF проходят контролируемую предобработку и маршрутизацию.
Очереди и лимиты внутри gateway pod, отмена и HTTP 429 защищают runtime; TLS, auth и tenant quotas остаются на внешнем proxy.
Выбор архитектуры
Это не универсальный multi-provider proxy. Gateway нужен, когда Triton должен остаться основным runtime, а продуктовым клиентам требуется знакомый контракт и model-specific orchestration.
Выбирайте, если клиент уже умеет работать с Triton API, repository и tensor contract.
Подходит для чистого vLLM endpoint, когда стандартного OpenAI server достаточно.
Маршрутизирует провайдеры и модели; при необходимости может располагаться уровнем выше gateway.
Сохраняет Triton и добавляет OpenAI-клиентов, media, context/reasoning policies, admission и telemetry.
ПодходитTriton уже используется; нужны OpenAI SDK, LibreChat или LiteLLM; в одном контуре работают chat, structured outputs, hybrid embeddings, rerank и multimodal модели.
Может быть лишнимНужен hosted API без собственной GPU-инфраструктуры, универсальный routing между SaaS-провайдерами или только один стандартный vLLM endpoint.
Релиз v0.3.0 · 25 августа 2026
Существующие chat, embeddings, rerank и multimodal endpoint-ы остаются обратно совместимыми. Hybrid embeddings — опциональное расширение gateway.
OpenAI response_format поддерживает json_object и строгий JSON Schema output.
Параметр seed, нормализованные system messages и корректный finish_reason=length.
Ограниченные последовательные micro-batch уменьшают риск CUDA OOM и сохраняют порядок документов.
BGE-M3 возвращает dense и lexical sparse vectors через native vLLM pooling или Python fallback.
disabledcontexttruncatereranktop_nКоротко об архитектуре
Authentication и TLS остаются на внешнем proxy. Gateway управляет запросом, Triton — жизненным циклом моделей, vLLM — выполнением и batching.
Открыть полную схемуИзучить подробнее
Проверьте поддерживаемые сценарии, разберите путь запроса и подготовьте пилот в своём контуре.
Structured outputs, media, hybrid embeddings и rerank в понятных матрицах.
02Components & flowTrust boundary, ответственность компонентов и полный жизненный цикл запроса.
03Operate safelyRuntime 26.07, Docker, Helm, monitoring, migration и production checklist.
Open source · Apache 2.0
Пилот должен подтвердить OpenAI SDK, JSON Schema output, hybrid retrieval, управляемый 429 и наблюдаемость на вашей GPU-топологии.