Gateway 模式
gateway 模式决定客户端流量从哪里进入,目标决定整套服务在哪里运行。它们与 --engine 是不同的选择:--engine 提供原生判断请求,不启用 Chat 路由;省略时启动 Router 模式。共用的前端与模型运行时见组件架构。
| 模式 | 客户端流量进入 | 适用场景 |
|---|---|---|
standalone(默认) | Router 本身,它在配置的 listeners 上提供 OpenAI 兼容接口 | 单机、开发、边缘、大多数自托管 |
extproc | Router 前面的基于 Envoy 的网关,Router 提供 ext_proc | 需要限流、mTLS、高级路由匹配等 Envoy 能力,或接入你已有的网关 |
| 目标 | standalone | extproc |
|---|---|---|
docker(默认) | Router 容器服务 listener,没有 Envoy 容器 | CLI 启动 的 Envoy 容器位于 Router 之前,与以前的版本一致 |
kubernetes | Router Pod 服务 listener,由 Service 暴露 | Router 为你的 Envoy Gateway、Envoy AI Gateway、Istio 或 KServe 提供 ext_proc |
vllm-sr serve # standalone,docker
vllm-sr serve --gateway extproc # Envoy 在前,docker
vllm-sr serve --target kubernetes --config config.yaml
除非你需要上面列出的 Envoy 功能,否则先用 standalone。在 docker 目标上,切换模式就是用当前生效的配置重启:运行 vllm-sr serve --gateway extproc,再运行普通的 vllm-sr serve 即可切回。standalone 模式下没有 Envoy 容器,所以 vllm-sr logs envoy 和 x-envoy-* 响应头只属于 extproc