跳到主要内容
版本:最新版

使用场景

只要应用应请求结果、而不必知道物理模型拓扑,语义路由就有用。同一请求约定可以覆盖托管 API、共享数据中心机群、小型边缘池或混合企业部署。变化的是策略边界,以及谁拥有模型执行。

下面的环境并不互斥。许多部署用数据中心池处理一般流量,用边缘模型处理私有或离线工作,再用选定的云提供方覆盖专项能力。

这就是实用的 Mixture-of-Models 模式:客户端使用稳定的虚拟模型身份,配方描述路由行为,部署特定的提供方绑定把配方的逻辑模型角色连接到各环境中可用的端点。

一览​

环境典型问题Semantic Router 决定什么仍在 Router 之外的部分
云多个提供方 API 在能力、成本、延迟和可用性上不同。哪个已批准的提供方或虚拟目标应处理请求。提供方容量、计费、区域服务健康和账户策略。
数据中心共享加速器机群服务具有不同优势和资源画像的模型。哪个模型池符合任务、策略和请求目标。副本放置、批处理、自动扩缩容和设备调度。
边缘容量有限,数据可能需要留在本地或离线工作。本地路径是否具备能力,以及是否允许远程升级。设备运行时、模型打包、功耗限制和网络可用性。
企业混合工作负载跨越租户、区域、信任域以及内部或外部提供方。在身份、驻留、能力和路由策略下哪些路径合格。身份签发、网络控制、密钥管理和数据治理。

云:用一条策略覆盖多个模型服务​

云应用常常接入不止一个模型提供方。某个提供方可能提供最好的视觉模型,另一个更适合长上下文,较小的托管模型则可能是日常聊天的经济默认项。

Semantic Router 可以暴露一个稳定的模型 API,同时让决策考虑:

  • 任务意图、模态、上下文长度和工具要求;
  • 提供方允许名单以及区域或合同约束;
  • 在合格集合内的成本、延迟或质量目标;以及
  • 当预路由证据排除某条路径时,显式升级或拒绝。

这把提供方选择移出应用代码。它不会让提供方账户可以互换:凭据、配额、数据使用条款和区域可用性仍需显式管理。

示例: 文档助手把普通文本路由到经济模型,把带图像的请求路由到具备视觉能力的提供方,把对证据敏感的问题路由到校验路径。客户端继续请求同一个公开模型名。

数据中心:把工作负载匹配到共享模型机群​

数据中心可能在同一加速器机群上服务多个开源或私有微调模型。服务平台知道哪些副本健康、哪里有容量;它通常不知道哪个模型家族最符合请求的含义。

Semantic Router 补上这一模型级决策:

  • 把代码、数学、语言或领域工作发送到专项池;
  • 拒绝缺少所需模态、上下文或工具支持的候选;
  • 把更大的模型或多模型工作流留给值得额外算力的请求;以及
  • 在同一物理机群上暴露均衡、快速、经济或准确度优先的虚拟模型。

边界是刻意的:Semantic Router 选择模型或模型池;推理平台选择副本,并拥有批处理、缓存局部性、自动扩缩容和加速器调度。

示例: 内部 AI 平台暴露 assistant-fast 和 assistant-accurate。两个入口共享同一提供方池,但隔离的配方使用不同的资格规则和选择算法。

边缘:容量受限下的本地优先路由​

在边缘,隐私、间歇连接、内存和功耗可能比访问最大模型更重要。有用的策略从本地能力出发,把远程执行当作显式选择,而不是隐式回退。

Semantic Router 可以:

  • 把敏感或可离线处理的流量留在本地模型上;
  • 在设备或本地网络上可用的小型专项模型中选择;
  • 拦截本地池无法安全处理的请求;或
  • 在策略和连通性允许时,把选定请求升级到已批准的远程模型。

“本地”不是端到端隐私保证。网络路由、日志、回放、缓存、工具调用和远程回退必须遵守同一边界。

示例: 现场助手在本地回答常见文本请求,在已连接时把图像请求路由到本地视觉服务,并在无法保证时失败关闭,而不是把受保护内容发到公共端点。

企业:在混合模型访问中执行策略​

企业部署通常组合内部模型、区域数据中心池、边缘系统和已批准的外部提供方。核心问题不只是找到“最好”的模型,而是找到对该用户、租户、数据类别和工作负载都允许的最佳路径。

Semantic Router 可以把这些选择写清楚:

  • 把授权、元数据和内容信号用作资格约束;
  • 在独立配方中隔离产品、租户或目标特定策略;
  • 把受监管流量留在已批准区域或本地池内;
  • 保持工具、模态、上下文和提供方兼容性;以及
  • 在回放被有意启用并受保护时,记录路由结果以供评估或审计。

Router 补充身份、网络分段、密钥管理、留存策略和提供方治理。它不替代它们;除非决策据此行动,仅有信号检测并不会执行策略。

示例: 全公司助手在各业务单元使用同一个 API。公开问题可以使用已批准的托管提供方,机密提示词留在内部池,受限配方则为高敏感工作负载去掉远程和启用工具的路径。

跨环境的模式​

同一组路由模式出现在全部四种环境中:

能力路由​

先剔除无法满足请求模态、上下文、工具或语言要求的模型,再比较成本或延迟。

专项路由​

用语义和确定性信号,把代码、数学、研究或领域特定工作导向合适的模型池。

基于目标的虚拟模型​

为均衡、快速、经济、准确度优先或私有行为暴露稳定的公开名称,同时运维人员演进底层池。

有界恢复与编排​

仅在额外调用具有可度量价值时,才在低置信度时升级、比较多个答案,或运行有界工作流。

策略优先路由​

先应用授权、本地性、数据处理和能力约束,再由优化算法对剩余候选排序。

选择起点​

  1. 识别物理模型池,以及拥有其执行的系统。
  2. 在质量、延迟或成本目标之前,先定义硬资格边界。
  3. 为客户端应有意选择的每种行为暴露一个公开入口。
  4. 从简单决策和静态选择开始。
  5. 仅在信号或算法会改变已观察到的路由结果时再添加它们。
  6. 在变更生产策略之前,用探针验证代表性请求。

继续阅读路由流水线,或浏览配方 Model Card查看完整示例。