与 NVIDIA Dynamo 集成
当 NVIDIA Dynamo 已经负责模型服务,而你希望 Semantic Router 在 Dynamo 将请求调度到推理 worker 之前 选择模型或策略时,使用此集成。
两层路由在不同层次做决策:
| 层次 | 职责 |
|---|---|
| Semantic Router | 解析入口,评估语义信号和策略,运行请求插件,并选择提供商模型。 |
| Dynamo | 协调推理图,暴露其 OpenAI 兼容前端,并按其服务拓扑和缓存感知路由选择 worker。 |
Semantic Router 必须选择 Dynamo 前端所服务的模型名称。随后 Dynamo 可以在该模型的 worker 之间选择。
Client
-> Envoy Gateway
-> Semantic Router (ExtProc)
-> Dynamo frontend
-> Dynamo router and inference workers
语义响应缓存与 Dynamo KV-cache 路由相互独立。Semantic Router 缓存可以复用先前响应;Dynamo 的路由器在服务新请求时复用或预测 token 级前缀状态。
前置条件
需要:
- Kubernetes
1.33–1.36