Components & request flow

Тонкий control layer внутри inference-платформы

Gateway отвечает за протокол, подготовку входа и контроль запроса. Triton и vLLM сохраняют ответственность за модели, scheduling, batching и GPU-выполнение.

Trust boundary

Клиентский трафик должен входить через внешний TLS/auth proxy. Raw Triton и metrics остаются в доверенной сети.

System map

Компоненты и границы доверия

Внешняя зона
Доверенная inference-сеть
AI clientsSDK · LiteLLM · LibreChat
Auth proxyTLS · auth · quotas
FastAPI Gateway :8080protocol · context · media · queues
NVIDIA Tritonrepository · lifecycle · metrics
Model backendsvLLM · multimodal · hybrid embeddings · rerank
Model lifecycle
S3 model repositoryweights · config · gateway.json
→
Triton workspacetemporary repository-agent paths
→
Model watchertemp paths · active links · cleanup
→
Active model linktokenizer · metadata · gateway.json
Gateway reads
Telemetry
GatewayTriton / vLLMDCGM
→
Prometheus + OTLPmetrics · optional joined traces
Client response: Server-Timing · X-Request-ID · optional X-Trace-ID

Request lifecycle

Что происходит от POST до первого SSE-токена

01

Ingress

Proxy проверяет identity, TLS и tenant quotas, затем передаёт запрос на :8080.

02

Admission

Gateway применяет per-pod global/route/model concurrency, очередь и timeout; при насыщении возвращает 429.

03

Prepare

Media ограничивается и декодируется; chat template, context policy, response_format, seed, tools и token budget формируют input.

04

Infer

Gateway вызывает Triton, а vLLM выполняет scheduling, continuous batching и генерацию на GPU.

05

Normalize

Structured output, tool calls, reasoning, finish_reason и usage приводятся к OpenAI-совместимому JSON/SSE; timings записываются в telemetry.

06

Stream / cancel

SSE отправляется клиенту. При disconnect gateway отменяет Triton stream и освобождает ресурсы.

Request policy · v0.3

Structured output, контекст и retrieval ограничены в одном flow

До inference

Input contract

response_format задаёт JSON object или строгую JSON Schema; seed делает sampling воспроизводимым, а context policy ограничивает историю.

После inference

Output contract

System messages нормализуются; reasoning policy сохраняется, а исчерпание token budget даёт finish_reason=length.

Retrieval

Bounded execution

BGE-M3 возвращает dense и sparse vectors; rerank делит документы на последовательные micro-batch и затем применяет selection.

Responsibility matrix

Кто за что отвечает

Проведите влево, чтобы увидеть остальные столбцы

Кто за что отвечает
КомпонентОтвечает заНе отвечает за
External proxyTLS, auth, authorization, tenant quotasPrompt processing и model inference
GatewayOpenAI protocol, context, media, tools parsing, admission, telemetryGPU scheduling и выполнение tools
TritonModel repository, lifecycle, backend execution, metricsOpenAI messages и пользовательская аутентификация
vLLM backendToken generation, batching, KV cache, parallelismClient protocol и внешняя trust boundary
ApplicationBusiness logic и фактическое выполнение toolsModel lifecycle внутри Triton

Переведите схему в production-конфигурацию

На странице развёртывания — закреплённая runtime-матрица, Docker/Helm, telemetry и checklist безопасности.

Перейти к развёртыванию