跳到主要内容
版本:v0.4

为何需要语义路由

没有哪个模型能对所有请求都最好。模型在推理能力、延迟、价格、语言、上下文长度、模态、工具使用、部署位置和安全画像上各不相同。模型池也会随升级、扩缩容或临时不可用而变化。

没有路由层时,每个应用都要理解这些差异。模型选择变成客户端条件分支,策略在各服务间复制,后端一变就可能要发一次应用版本。

语义路由把这项决策放到服务路径上。

它要解决的问题​

模型选择泄漏到应用里​

应用应表达自己需要什么,而不是维护一份模型端点清单。稳定的公开模型名让路由策略和物理池可以变更,而不必改每个客户端。

约束和偏好被混在一起​

有些要求不可妥协:授权、隐私、数据驻留、模态、上下文容量或工具兼容性。另一些是要优化的目标,例如质量、延迟和成本。有用的路由器会先剔除无效路径,再只对剩余候选排序。

一条路由规则不够用​

关键词能表达硬策略,但无法覆盖所有语义意图。分类器能识别意图,但不应覆盖授权边界。运行时指标能选出健康副本,却不理解任务。Semantic Router 把这些职责分开,再组合成一次决策。

物理池是动态的​

路由既是语义问题,也是系统问题。请求描述工作负载;模型池贡献容量、健康、延迟和放置。Router 必须把这两种视角连起来,而不能让其中任何一种单独成为全部策略。

有些答案需要协作​

选一个模型往往就够了。另一些任务则受益于升级、校验、并行意见或有界工作流。这些是不同的执行模式,应当显式声明,而不是藏在应用代码的重试里。

设计目标​

vLLM Semantic Router 围绕五个目标设计:

  1. 一个稳定 API,覆盖多个后端。 客户端使用公开入口,运维人员在背后管理模型池。
  2. 策略可读、可测。 信号、投影、决策、算法和插件是具名配置对象,而不是散落的条件分支。
  3. 先划硬边界,再做优化。 不合格路由先被剔除,质量、延迟、成本或负载才影响选择。
  4. 选择与编排在同一系统中。 一条路由可以选择一个模型、级联、比较或协调多个模型。
  5. 运维反馈。 回放、评估、指标和用户反馈支撑有意识的策略变更。

Semantic Router 不是什么​

  • 它不是 LLM 服务器。vLLM、Ollama 或托管提供方等后端仍负责运行模型。
  • 它不只是负载均衡器。副本健康很重要,但请求含义和策略决定哪个模型池有资格。
  • 它不是通用质量保证。路由质量取决于已配置的模型、信号、策略和评估数据。
  • 它不替代网络、身份或数据治理控制。它在更广的安全架构内执行路由策略。

下一步​

阅读系统概览了解组件与请求生命周期,再看使用场景了解具体路由模式。