跳到主要内容
版本:最新版(未发布)

sr-bench 1.0

sr-bench 使用相同的冻结题目比较 MoM 入口与单模型。CLI 和 Dashboard → Evaluation 共用一个持久化服务、运行 ID、结果与报告。先用小规模开发集改进路由,再用不相交的保留集验收。

选择题量​

下表是每个目标的完整任务数,不是模型调用次数。代码、Agent、裁判和用户模拟器可能产生多次调用;辅助调用费用单独报告。

基准 ID能力SmokeQuick/devStandard/holdout
mmlu-pro14 个学科的知识145002,000
gpqa-diamond科学推理440158
hleHLE 纯文本推理440200
livecodebenchv6 累积编程题230150
scicode科学编程完整主问题1320
terminal-bench-2.1隔离终端任务1315
simpleqa-verified事实准确性5100500
arc-agi-2公开评测谜题与精确网格输出21280
tau3τ³ 三个文本交互领域31260
总计367403,183

用 vllm-sr benchmark catalog 检查当前安装版本。允许只选择某个能力切片;500 题 MMLU-Pro 开发集不是上游 12,032 题的全量结果。缺少任一基准时,没有完整 sr-bench 分数。

数据准备固定来源版本、内容哈希、任务 ID、种子和分层算法。Smoke 是 quick 的子集,standard 与 quick 不相交。SciCode 子问题保留在同一个任务中。公开题目不能宣称无污染;已看过标签的 GPQA 结果仍需注明复测。