SDK выполняет streaming chat, JSON Schema output и seed без собственного Triton-адаптера.
Operate safely
Развёртывание с закреплённым runtime и явными границами
v0.3.0 добавляет structured outputs, deterministic sampling, hybrid embeddings и bounded rerank поверх прежней проверенной матрицы Triton 26.07 / vLLM 0.24.0.
26.07 нужно проверять как цельную runtime-матрицу. Не обновляйте vLLM, Triton client или core-зависимости независимо от базового образа.
Runtime migration
Что изменилось относительно 26.06
Существующие chat, embeddings, rerank и multimodal endpoint-ы обратно совместимы. /v1/hybrid_embeddings — опциональное расширение; для LiteLLM нужен явный pass-through.
Проведите влево, чтобы увидеть остальные столбцы
| Компонент | 26.06 | 26.07 | Статус |
|---|---|---|---|
| Triton Server | 2.70.0 | 2.71.0 | Обновлён |
| NVIDIA vLLM | 0.22.1 | 0.24.0 | Обновлён |
| Transformers | 5.6.0 | 5.6.1 | Обновлён |
| FlashInfer | 0.6.12 | 0.6.14 | Обновлён |
| CUDA | 13.3.0 | 13.3.4.1 | Обновлён |
| NCCL | 2.30.4 | 2.30.7 | Обновлён |
| Python | 3.12 | 3.12 | Без изменений |
Pilot path
Пилот на одной модели: build → run → verify
docker build \
-f Dockerfile.triton-gateway \
-t triton-openai-gateway:26.07 .Замените S3_ENDPOINT/BUCKET/PREFIX и подготовьте .env. Веса моделей не входят в проект; нужны NVIDIA driver, Container Toolkit и совместимая GPU.
Pilot acceptance
Критерии успешного пилота
Hybrid embeddings возвращают dense + sparse, а большой rerank проходит bounded micro-batches.
Disconnect клиента отменяет Triton stream и освобождает admission slot.
Метрики видны; при настроенном OTLP trace связывает Gateway и Triton.
Три разных состояния готовности
/healthFastAPI отвечает/readyTriton ready/v1/models + repository indexloading → readyНаблюдаемость
Найдите узкое место по этапам одного запроса
Server-Timing показывает время на каждом этапе, а метрики Gateway, Triton/vLLM и GPU помогают определить источник задержки или перегрузки.
Путь одного запроса
Источники сигналов
:8080/metricsGateway metrics
API latency, очередь, 429, context, rerank и TTFT.
:8002/metricsTriton + vLLM
Scheduler, running/waiting, KV cache, prefill и decode.
:9400/metricsDCGM
Загрузка GPU/MIG, память, питание и состояние оборудования.
OTLP collectorOpenTelemetry
Путь конкретного запроса Gateway → Triton при общем trace context.
HTTP · SSEОтвет клиенту
Request ID, inference timing, trace ID и состояние context policy.
Метрики и traces не содержат prompts, media, responses, tool results или reasoning content. DEBUG_LOG_PAYLOADS может раскрыть preview пользовательских данных.
Production checklist
Что проверить перед внешним трафиком
Edge security
TLS, authentication, authorization и tenant quotas перед :8080.
Network
Raw Triton :8000–8002 и metrics не публикуются наружу; NetworkPolicy разрешает только нужные связи.
Secrets
S3 credentials хранятся в Kubernetes Secret или внешнем secret manager.
Limits
Request body, remote media, pages, pixels, frames, queue и timeout ограничены по результатам тестов.
Lifecycle
Проверены load/unload, restart pod, client cancellation и termination grace period.
Canary
Chat, structured outputs, seed, hybrid embeddings, rerank, tools и media проверены на каждой TP/PP/DP/EP-топологии.
Monitoring
Alerts настроены на errors, queue growth, latency, memory pressure и model availability.
Supply chain
Image закреплён по digest; runtime verification, NOTICE и third-party license notices сохранены.
v0.3.0
Релиз v0.3.0 прошёл расширенную валидацию
Community release без коммерческого SLA
Поддержка идёт через GitHub Issues, уязвимости — по SECURITY policy. Оператор отвечает за GPU/driver, модель, capacity limits, network boundary и canary на своей топологии.
Triton OpenAI Gateway v0.3.0
Существующие chat, embeddings, rerank и multimodal endpoint-ы обратно совместимы. /v1/hybrid_embeddings — опциональное расширение; для LiteLLM нужен явный pass-through.