数据 · 专业Workspace数据 · 证据

这批数据能把模型分开吗

3 个前沿模型, 每个对每道任务独立完成 3 次, 共 72 次完整运行。评分判官轮换, 被评模型不参与自身评分。下面是全部结果、失败去向与难度对照。

72完整运行
8任务 / 每个跑 3 次
47未达标运行
31%失败中自述已完成
8/8参考解满分任务
§ 1 · Leaderboard

基线榜单

通过 = 总分 ≥ 0.9 且核心验收条款全部通过。pass@1 为每道任务 3 次通过率再对任务取平均(一次就做对的可靠度); pass@3 为 3 次里至少 1 次通过的任务占比(多给机会能否解出)。

1GLMglm-5.3
46%pass@1
50%pass@3
0.502均分
2DeepSeekdeepseek-v4-flash
38%pass@1
50%pass@3
0.490均分
3MiniMaxMiniMax-M3
17%pass@1
25%pass@3
0.376均分

三个模型拉开差距的地方不是「能不能做出来」, 而是「能不能稳定做对」: pass@3 最高与最低相差 25 个百分点, 而一次就做对的 pass@1 相差 29 个百分点。7 道任务上出现过失败; 没有一道任务被所有模型稳定解出, 也没有一道无解 —— 每道任务的参考解都取得满分。

§ 2 · Failure modes

失败去向

47 次未达标运行, 每次只归入一个原因 —— 取最早断掉的环节。下表分母是全部未达标运行。

  • 未按要求的方式交付4 道任务 · 26 次 · 55%成果交出来了, 但不是任务书指定的形式 —— 例如要求通过程序接口交付, 只给了一份文档。交付形态本身就是要求的一部分, 形式不对则内容不计分。
  • 核心要求未达成4 道任务 · 16 次 · 34%形式正确, 但任务的核心验收条款没有通过: 关键行为没做到, 或关键数值不达标。这类失败的得分被封顶。
  • 只完成了一部分2 道任务 · 5 次 · 11%主要要求达成, 次要要求有缺失 —— 离通过只差一小段。
§ 3 · Per model

每个模型撞上多少次

上表看的是「失败都去了哪」; 这里看的是「某个模型自己有多常撞上」—— 分母换成该模型自己的 24 次运行, 两张图不可混读。

未按要求的方式交付最多与最少相差 1 次
012 次24 次
核心要求未达成最多与最少相差 4 次
012 次24 次
只完成了一部分最多与最少相差 3 次
012 次24 次
GLMMiniMaxDeepSeek
模型未按要求交付核心要求未达成只完成一部分失败合计通过
GLM69%31%0%1311/24
DeepSeek60%27%13%159/24
MiniMax42%42%16%194/24

颜色深浅表示该阶段占这个模型自己失败的比例 —— 每行独立读, 不跨行比较绝对数。

§ 4 · By task

逐任务表现

8 道任务 × 每模型 3 次尝试的通过次数。没有一道任务被所有模型稳定解出, 也没有一道无解。

任务GLMDeepSeekMiniMax
历史版本 CLI 工具架构调查3/33/33/3
CIS 视觉检测与打印联动0/30/30/3
游戏引擎确定性模拟内核2/32/30/3
专业内容选题与创作工作流0/30/30/3
晶圆基板缺陷自动计数0/30/30/3
研发效能插件分析与仓库治理3/33/31/3
IMU 零偏在线学习状态机0/30/30/3
量化交易系统演进规划3/31/30/3
§ 5 · Characteristic

各模型的特征性失败

不看谁的失败最多, 而看某个模型与另外两家相比最不一样的地方 —— 小样本下这比绝对占比更稳。

模型与另两家差异最大的失败类型
GLM极少只完成了一部分 —— 本模型 0 次, 另两家中位 2 次
DeepSeek极少核心要求未达成 —— 本模型 4 次, 另两家中位 6 次
MiniMax更常核心要求未达成 —— 本模型 8 次, 另两家中位 4 次

另一个贯穿三家的现象: 未达标的 47 次里有 15 次(31%)模型在最终回复中仍表示已完成 —— 约三分之一的失败里, 模型没有意识到自己没达标。这正是可执行验证存在的理由: 自测通过不等于验收通过。

轨迹样例 · 模型自测通过 ≠ 验收通过

模型在最终回复中自述已验证通过:

**验证**:真实 Chromium 打开 `file://` 全部通过(无 console/page 报错、契约可用、评测方独立车模型下 t=45.2 s 自主进入自愈、48.5 s 报告成功、`biasEst→6.004` 而真值 6.0、恢复后不再持续旋转),另有 Node

但在判卷方的多工况验证下, 该任务的核心验收条款未通过, 得分被封顶。轨迹样例仅作定性说明, 不计入上述任何统计。

§ 6 · Positioning

这批任务有多难

把这 8 道任务和业界公开评测集放在同一套能力需求标准下比较: 先看它和哪些公开集最像, 再由最像的那几个推出预期难度, 最后与实测对照。标注方法与全部口径见 难度口径

和哪些公开评测集最像

名次公开评测集相似度结果稳定性该集公开最好成绩计分方式
1Terminal-Bench67.5%44%59.6%pass@1
2GDPval66.9%34%1735 EloElo
3GDP.pdf64.9%7%32.2%all-pass rate
4AA-Briefcase64.0%15%1678 EloElo

相似度按 27 项能力需求的整体接近程度计算(满分 100)。要判断 67.5% 算高还是低, 可以对照两组公认考同一类能力的集合, 以及任意两个集合的一般水平:

参照: 两个集合之间相似度
SciCode 与 HLE87.2%
Terminal-Bench 与 ALE 工程任务集79.6%
任意两个公开评测集(中位水平)56.0%

本数据集与 Terminal-Bench 的相似度 67.5%, 明显高于任意两集的一般水平, 但低于上面两组同类集合之间 —— 也就是说它和终端型 agent 评测集属于近亲, 但不是同一种东西。结果稳定性指的是: 只有 8 道任务, 把它们有放回地重抽 2,000 次, 该集仍排第一的比例; 因此下面的判断同时用前两名, 不只看第一名。

由此推出的预期难度, 与实测对照

事前预期

32.2% – 59.6%

最像的几个公开集里, 用百分比计分的有两个: Terminal-Bench 最好成绩 59.6%(逐题对错)、GDP.pdf 最好成绩 32.2%(一题的全部判据都过才算)。本数据集的判分是可执行验证加判据评审的混合并带封顶条款, 接近逐题对错, 因此预期通过率落在这个区间。

实际测得

46%

本页 §1 的基线里表现最好的模型 pass@1 为 46%, 落在预期区间内、偏中低端。两点都指向低端且都成立: 其一, 本数据集对结果精度与自我验证的要求高于最相似的公开集; 其二, 这批基线用的是三个主流模型, 而各公开集的最好成绩来自当前最强的前沿模型 —— 换前沿模型来跑, 分数预计更高。

预期区间是在基线运行之前、仅凭能力需求标注推出的, 与实测过程互不相干; 实测结果落在区间内, 说明这套难度判断对本数据集是有效的。

能力覆盖对照

评测集题数重点考察的能力知识深度总体需求强度该集公开最好成绩
本数据集815/224.02.59
Terminal-Bench6616/224.242.4659.6%
GDPval22012/223.792.191735 Elo
GDP.pdf10010/223.512.1232.2%
ALE 工程任务集13914/224.272.26
AutomationBench80613/222.881.6968.9%

重点考察的能力指一半以上题目都要求达到较高水平的那些能力项, 数字越大说明一道题同时考的方面越多。本数据集为 15 项, 与 Terminal-Bench(16)、ALE 工程任务集(14)同级, 高于 GDPval(12)。本数据集尚未用前沿模型跑过完整榜单, 故最后一列留空。

补上了公开评测集的哪些空白

  • 表达: 本数据集 7/8 道任务重点考察; 全部公开评测集里只有 1 个重点考察这一项, 最高为 GDPval 的 61%。
  • 概念学习: 本数据集 6/8 道任务重点考察; 全部公开评测集里只有 1 个重点考察这一项, 最高为 Terminal-Bench 的 82%。

这两项是本数据集相对公开集合最实在的增量: 真实专家工作要求把结论写成可交付的产物(表达), 并在过程中形成原本不存在的新概念(概念学习) —— 而绝大多数公开评测集不考这两件事。

逐任务定位

任务重点考察的能力最相似的公开集题目来源(最近 15 道)通过
晶圆基板缺陷自动计数21ALE 7、Terminal-Bench 6、GDPval 20/9
CIS 视觉检测与打印联动19Terminal-Bench 7、ALE 5、GDPval 20/9
IMU 零偏在线学习状态机17ALE 6、Terminal-Bench 6、GDPval 20/9
专业内容选题与创作工作流15GDPval 9、AA-Briefcase 2、ALE 20/9
游戏引擎确定性模拟内核14Terminal-Bench 9、ALE 5、AutomationBench 14/9
研发效能插件分析与仓库治理13AutomationBench 7、GDPval 6、ALE 27/9
历史版本 CLI 工具架构调查12AutomationBench 8、GDPval 5、ALE 19/9
量化交易系统演进规划12GDPval 6、GDP.pdf 6、ALE 24/9

每道任务在题目层面找最接近的公开集题目, 括号内为最近 15 道题的来源分布。同时考察的能力越多, 通过次数越少。

想看模型的完整轨迹与逐判据结果?样本集附检查项级评分报告与全部验证资产
申请样本

数据受样本评估许可约束(30 天 · 仅限评估)联系商务 · 申请样本最后更新 2026-09-19