为何需要语义路由
通过策略选择模型,无需在每个 harness 集成中硬编码。模型在推理能力、延迟、价格、语言、上下文长度、模态、工具、位置和安全性上各不相同,可用性也会随升级、扩缩容与故障变化。共享路由策略让 harness 在任务中适应这些差异,无需重复模型选择逻辑。
它要解决的问题
模型选择与 harness 耦合
Harness 的任务循环与工具在不断演进,因此需要稳定的模型契约。公开模型入口让路由策略和物理池可以独立于每个 harness 的集成而变更。
约束和偏好被混在一起
有些要求不可妥协:授权、隐私、数据驻留、模态、上下文容量或工具兼容性。另一些是要优化的目标,例如质量、延迟和成本。有用的路由器会先剔除无效路径,再只对剩余候选排序。
一条路由规则不够用
关键词能表达硬策略,但无法覆盖所有语义意图。分类器能识别意图,但不应覆盖授权边界。运行时指标能选出健康副本,却不理解任务。Semantic Router 把这些职责分开,再组合成一次决策。
物理池是动态的
路由既是语义问题,也是系统问题。请求描述工作负载;模型池贡献容量、健康、延迟和放置。Router 必须把这两种视角连起来,而不能让其中任何一种单独成为全部策略。
有些答案需要协作
选一个模型往往就够了。另一些任务则受益于升级、校验、并行意见或有界工作流。这些是不同的执行模式,应在路由策略中显式声明。外层任务循环和工具执行仍由 harness 负责。
设计目标
vLLM Semantic Router 围绕五个目标设计:
- 一个稳定 API,覆盖多个后端。 Harness 使用公开入口,运维人员在背后管理模型池。
- 策略可读、可测。 信号、投影、决策、算法和插件是具名配置对象,而不是散落的条件分支。
- 先划硬边界,再做优化。 不合格路由先被剔除,质量、延迟、成本或负载才影响选择。
- 模型选择与有界协作。 一条路由可以在已配置的限制内选择一个模型、级联、比较或协调多个模型。
- 运维反馈。 回放、评估、指标和用户反馈支撑有意识的策略变更。
Semantic Router 不是什么
- Agent harness 负责任务编排、工具执行与持久任务状态;Router 为其中的模型调用提供决策。
- Chat 生成由 vLLM、Ollama 或托管提供方等后端负责。内置模型运行时负责判断、分类、embedding 等任务,也可以通过 System One 直接提供判断模型服务。
- 它不只是负载均衡器。副本健康很重要,但请求含义和策略决定哪个模型池有资格。
- 它不是通用质量保证。路由质量取决于已配置的模型、信号、策略和评估数据。
- 它不替代网络、身份或数据治理控制。它在更广的安全架构内执行路由策略。
下一步
阅读系统概览了解组件与请求生命周期,再看使用场景了解具体路由模式,并通过 agent harness 指南完成集成。