跳到主要内容
版本:最新版

接入 Agent Harness

将 Harness 连接到 vllm-sr/auto 等 Router 入口。Harness 管理 Agent 循环、工具和 任务状态;Router 按策略选择模型或执行有界多模型工作流,推理后端执行模型调用。

先安装 Router,或让 Agent 安装。

选择推理连接​

配置 Harness 的模型提供方;配置项名称以安装版本为准。

设置使用什么
推理地址公开推理监听器或网关。本地快速开始使用 http://localhost:8899;管理 API 和控制面板使用不同地址。
客户端协议根据 Harness 实际发送的请求,选择 OpenAI Chat Completions、OpenAI Responses 或 Anthropic Messages。
公开模型 ID默认策略使用 vllm-sr/auto,也可选择 GET /v1/models 返回的已发布入口。
身份验证推理监听器或网关要求的凭据。后端提供方凭据由运维人员单独配置。
模型限制与能力所选配方能够支持的上下文、输出、工具、视觉和推理设置。

客户端可能自行添加 /v1。请检查最终路径:

客户端 API最终请求路径要求
Chat CompletionsPOST /v1/chat/completions发送 Chat Completions 请求格式。
ResponsesPOST /v1/responsesRouter 的 global.services.response_api 及其存储必须可用。
MessagesPOST /v1/messages发送 Messages 请求格式和合适的 anthropic-version 请求头。

客户端与后端可在兼容性矩阵范围内使用不同协议。自由格式的 custom tools 无法转到 Messages 后端;Codex CLI 的额外限制也列在该页。凭据使用 Harness 支持的密钥存储或环境绑定。

验证公开模型​

在本地栈中配置至少一个后端后,列出公开模型:

curl -sS http://localhost:8899/v1/models

使用虚拟入口应用路由策略。具体提供方模型名会绕过 配方路由。

发送最小请求并显示响应头:

curl -sS -i http://localhost:8899/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{
"model": "vllm-sr/auto",
"messages": [{"role": "user", "content": "Hello!"}]
}'

其他部署请使用对应的推理地址和身份验证。检查回答及 x-vsr-selected-recipe、 x-vsr-selected-model;HTTP 成功不代表输出有效或路由正确。详见 路由回执和 CLI 预览与探测。

运行任务前设置预算​

GET /v1/models 提供虚拟名称和路由元数据,不公布它们的上下文窗口或输出上限。 请在 Harness 中配置这些值。若要让每个候选模型都可用,应取配方可选择的所有模型 (包括配置的默认模型)的最小上下文窗口和输出上限,并仅启用它们共有的能力。

对于异构模型池,配方级 candidate_requirements 可以在评分前检查输出预算以及 声明的工具、推理和结构化输出能力,但它不会配置 Harness 自身的上下文管理。 示例和具体候选资格行为见虚拟模型:Agent 客户端的限制。

保持工具与对话连续性​

运行一次真实工具循环:模型请求工具 → Harness 执行 → 下次调用携带匹配结果。 流式请求还需检查完整工具参数、终止事件和最终回答。协议兼容不代表模型与 Harness 已通过端到端验证。

配置 Router Learning 保护时,需要提供显式身份。默认 scope: conversation 要求 相关调用同时携带两个请求头:

x-session-id: harness-demo-session
x-conversation-id: harness-demo-conversation

这些只是示例值。由 Harness 或受信任网关为实际 session 和 conversation 提供各自 稳定的标识符。scope: session 只要求配置中的 session 请求头。缺少必需身份时, 请求仍可路由,但保护不会保持模型。Responses 历史(包括 previous_response_id) 不能替代这些请求头。身份优先级和隐私边界见会话标识。

检查工具后续调用和用户追问选中的模型。工具权限、任务状态和外层循环由 Harness 管理;配方不会配置委派 Agent。

编程入口背后的策略​

在同一入口背后连接模型并发布配方。 信号、决策和算法定义哪些模型可用,以及如何执行。

Agent Routing 配方 可作为本地、专家和前沿模型路径的起点。使用前请检查模型绑定、分类器要求和回放保留 策略;仓库中的配置会记录请求和响应数据。采用策略变更前,使用 配方评估工作流测试代表性任务。