Operate safely

Развёртывание с закреплённым runtime и явными границами

v0.3.0 добавляет structured outputs, deterministic sampling, hybrid embeddings и bounded rerank поверх прежней проверенной матрицы Triton 26.07 / vLLM 0.24.0.

Важно

26.07 нужно проверять как цельную runtime-матрицу. Не обновляйте vLLM, Triton client или core-зависимости независимо от базового образа.

Runtime migration

Что изменилось относительно 26.06

Существующие chat, embeddings, rerank и multimodal endpoint-ы обратно совместимы. /v1/hybrid_embeddings — опциональное расширение; для LiteLLM нужен явный pass-through.

Проведите влево, чтобы увидеть остальные столбцы

Что изменилось относительно 26.06
Компонент26.0626.07Статус
Triton Server2.70.02.71.0Обновлён
NVIDIA vLLM0.22.10.24.0Обновлён
Transformers5.6.05.6.1Обновлён
FlashInfer0.6.120.6.14Обновлён
CUDA13.3.013.3.4.1Обновлён
NCCL2.30.42.30.7Обновлён
Python3.123.12Без изменений

Pilot path

Пилот на одной модели: build → run → verify

01NVIDIA GPU + driver02Container Toolkit / GPU Operator03Triton model repository04Одна некритичная модель
docker build \
  -f Dockerfile.triton-gateway \
  -t triton-openai-gateway:26.07 .
image :26.07runtime verificationbuilt

Замените S3_ENDPOINT/BUCKET/PREFIX и подготовьте .env. Веса моделей не входят в проект; нужны NVIDIA driver, Container Toolkit и совместимая GPU.

Pilot acceptance

Критерии успешного пилота

01
OpenAI contract

SDK выполняет streaming chat, JSON Schema output и seed без собственного Triton-адаптера.

02
Retrieval

Hybrid embeddings возвращают dense + sparse, а большой rerank проходит bounded micro-batches.

03
Cancellation

Disconnect клиента отменяет Triton stream и освобождает admission slot.

04
Observability

Метрики видны; при настроенном OTLP trace связывает Gateway и Triton.

Три разных состояния готовности

Gateway process/healthFastAPI отвечает
Triton runtime/readyTriton ready
Target model/v1/models + repository indexloading → ready

Наблюдаемость

Найдите узкое место по этапам одного запроса

Server-Timing показывает время на каждом этапе, а метрики Gateway, Triton/vLLM и GPU помогают определить источник задержки или перегрузки.

Путь одного запроса

01Очередьadmission wait
02Подготовкаmedia · context · tokens
03Tritonscheduler · inference
04Постобработкаreasoning · tools · SSE
05Итогоend-to-end

Источники сигналов

01:8080/metrics

Gateway metrics

API latency, очередь, 429, context, rerank и TTFT.

02:8002/metrics

Triton + vLLM

Scheduler, running/waiting, KV cache, prefill и decode.

03:9400/metrics

DCGM

Загрузка GPU/MIG, память, питание и состояние оборудования.

04OTLP collector

OpenTelemetry

Путь конкретного запроса Gateway → Triton при общем trace context.

05HTTP · SSE

Ответ клиенту

Request ID, inference timing, trace ID и состояние context policy.

Без payload по умолчанию

Метрики и traces не содержат prompts, media, responses, tool results или reasoning content. DEBUG_LOG_PAYLOADS может раскрыть preview пользовательских данных.

Production checklist

Что проверить перед внешним трафиком

01

Edge security

TLS, authentication, authorization и tenant quotas перед :8080.

02

Network

Raw Triton :8000–8002 и metrics не публикуются наружу; NetworkPolicy разрешает только нужные связи.

03

Secrets

S3 credentials хранятся в Kubernetes Secret или внешнем secret manager.

04

Limits

Request body, remote media, pages, pixels, frames, queue и timeout ограничены по результатам тестов.

05

Lifecycle

Проверены load/unload, restart pod, client cancellation и termination grace period.

06

Canary

Chat, structured outputs, seed, hybrid embeddings, rerank, tools и media проверены на каждой TP/PP/DP/EP-топологии.

07

Monitoring

Alerts настроены на errors, queue growth, latency, memory pressure и model availability.

08

Supply chain

Image закреплён по digest; runtime verification, NOTICE и third-party license notices сохранены.

v0.3.0

Релиз v0.3.0 прошёл расширенную валидацию

208 automated tests68.21% combined coverageDocker image + 28 runtime pinsHelm lint + production render
Открыть release notes

Community release без коммерческого SLA

Поддержка идёт через GitHub Issues, уязвимости — по SECURITY policy. Оператор отвечает за GPU/driver, модель, capacity limits, network boundary и canary на своей топологии.

Triton OpenAI Gateway v0.3.0

Существующие chat, embeddings, rerank и multimodal endpoint-ы обратно совместимы. /v1/hybrid_embeddings — опциональное расширение; для LiteLLM нужен явный pass-through.

Release notes