智能,超越单一模型。


面向模型与算力的开放、可编程决策层。
为 agent harness 提供稳定的模型 API。vLLM Semantic Router 在 OpenAI 或 Anthropic 兼容端点背后,通过显式策略选择或组合模型。模型与策略可以演进,无需重写 harness 集成。
应用也可以直接调用 System One 获取类型化判断。Router 与 Engine 模式共享 Frontend 和模型运行时,配方增加可选的路由层。模块边界与副本池见 组件架构。
为什么需要路由?
一次调用需要快速的本地模型,另一次需要专项模型、更长上下文或多模型校验。能力、延迟、成本和信任边界随请求、用户、会话与可用基础设施变化。共享路由策略让每个 harness 无需重复编码这些选择。
你可以编程什么?
入口选择隔离的配方。信号捕获意图、难度、上下文、模态、身份、风险、偏好及已配置的运行时观测,用于:
- 选择或组合模型: 选择本地或专项模型,通过级联升级,或运行有界多模型工作流。
- 添加路由行为: 提示词、检索、记忆、工具过滤、缓存、安全检查和校验。
- 选择执行路径: 异构硬件上已配置的云、数据中心或边缘后端。
- 检查并改进决策: 路由元数据、反馈、回放和评估。
Harness 负责任务循环、工具执行与任务状态;Router 负责每次调用的策略和有界模型协作。 默认由 standalone Frontend 传输请求,Envoy 是可选的传输集成。模型运行时执行判断 和特征提取任务,外部推理平台运行 Chat 后端并管理其副本放置、批处理和容量。
从这里开始
项目
vLLM Semantic Router 以 Apache 2.0 许可开源。要提出变更或加入社区, 请参阅贡献指南。