这批数据能把模型分开吗
3 个前沿模型, 每个对每道任务独立完成 3 次, 共 72 次完整运行。评分判官轮换, 被评模型不参与自身评分。下面是全部结果、失败去向与难度对照。
基线榜单
通过 = 总分 ≥ 0.9 且核心验收条款全部通过。pass@1 为每道任务 3 次通过率再对任务取平均(一次就做对的可靠度); pass@3 为 3 次里至少 1 次通过的任务占比(多给机会能否解出)。
三个模型拉开差距的地方不是「能不能做出来」, 而是「能不能稳定做对」: pass@3 最高与最低相差 25 个百分点, 而一次就做对的 pass@1 相差 29 个百分点。7 道任务上出现过失败; 没有一道任务被所有模型稳定解出, 也没有一道无解 —— 每道任务的参考解都取得满分。
失败去向
47 次未达标运行, 每次只归入一个原因 —— 取最早断掉的环节。下表分母是全部未达标运行。
- 未按要求的方式交付4 道任务 · 26 次 · 55%成果交出来了, 但不是任务书指定的形式 —— 例如要求通过程序接口交付, 只给了一份文档。交付形态本身就是要求的一部分, 形式不对则内容不计分。
- 核心要求未达成4 道任务 · 16 次 · 34%形式正确, 但任务的核心验收条款没有通过: 关键行为没做到, 或关键数值不达标。这类失败的得分被封顶。
- 只完成了一部分2 道任务 · 5 次 · 11%主要要求达成, 次要要求有缺失 —— 离通过只差一小段。
每个模型撞上多少次
上表看的是「失败都去了哪」; 这里看的是「某个模型自己有多常撞上」—— 分母换成该模型自己的 24 次运行, 两张图不可混读。
| 模型 | 未按要求交付 | 核心要求未达成 | 只完成一部分 | 失败合计 | 通过 |
|---|---|---|---|---|---|
| GLM | 69% | 31% | 0% | 13 | 11/24 |
| DeepSeek | 60% | 27% | 13% | 15 | 9/24 |
| MiniMax | 42% | 42% | 16% | 19 | 4/24 |
颜色深浅表示该阶段占这个模型自己失败的比例 —— 每行独立读, 不跨行比较绝对数。
逐任务表现
8 道任务 × 每模型 3 次尝试的通过次数。没有一道任务被所有模型稳定解出, 也没有一道无解。
| 任务 | GLM | DeepSeek | MiniMax |
|---|---|---|---|
| 历史版本 CLI 工具架构调查 | 3/3 | 3/3 | 3/3 |
| CIS 视觉检测与打印联动 | 0/3 | 0/3 | 0/3 |
| 游戏引擎确定性模拟内核 | 2/3 | 2/3 | 0/3 |
| 专业内容选题与创作工作流 | 0/3 | 0/3 | 0/3 |
| 晶圆基板缺陷自动计数 | 0/3 | 0/3 | 0/3 |
| 研发效能插件分析与仓库治理 | 3/3 | 3/3 | 1/3 |
| IMU 零偏在线学习状态机 | 0/3 | 0/3 | 0/3 |
| 量化交易系统演进规划 | 3/3 | 1/3 | 0/3 |
各模型的特征性失败
不看谁的失败最多, 而看某个模型与另外两家相比最不一样的地方 —— 小样本下这比绝对占比更稳。
| 模型 | 与另两家差异最大的失败类型 |
|---|---|
| GLM | 极少只完成了一部分 —— 本模型 0 次, 另两家中位 2 次 |
| DeepSeek | 极少核心要求未达成 —— 本模型 4 次, 另两家中位 6 次 |
| MiniMax | 更常核心要求未达成 —— 本模型 8 次, 另两家中位 4 次 |
另一个贯穿三家的现象: 未达标的 47 次里有 15 次(31%)模型在最终回复中仍表示已完成 —— 约三分之一的失败里, 模型没有意识到自己没达标。这正是可执行验证存在的理由: 自测通过不等于验收通过。
模型在最终回复中自述已验证通过:
**验证**:真实 Chromium 打开 `file://` 全部通过(无 console/page 报错、契约可用、评测方独立车模型下 t=45.2 s 自主进入自愈、48.5 s 报告成功、`biasEst→6.004` 而真值 6.0、恢复后不再持续旋转),另有 Node
但在判卷方的多工况验证下, 该任务的核心验收条款未通过, 得分被封顶。轨迹样例仅作定性说明, 不计入上述任何统计。
这批任务有多难
把这 8 道任务和业界公开评测集放在同一套能力需求标准下比较: 先看它和哪些公开集最像, 再由最像的那几个推出预期难度, 最后与实测对照。标注方法与全部口径见 难度口径。
和哪些公开评测集最像
| 名次 | 公开评测集 | 相似度 | 结果稳定性 | 该集公开最好成绩 | 计分方式 |
|---|---|---|---|---|---|
| 1 | Terminal-Bench | 67.5% | 44% | 59.6% | pass@1 |
| 2 | GDPval | 66.9% | 34% | 1735 Elo | Elo |
| 3 | GDP.pdf | 64.9% | 7% | 32.2% | all-pass rate |
| 4 | AA-Briefcase | 64.0% | 15% | 1678 Elo | Elo |
相似度按 27 项能力需求的整体接近程度计算(满分 100)。要判断 67.5% 算高还是低, 可以对照两组公认考同一类能力的集合, 以及任意两个集合的一般水平:
| 参照: 两个集合之间 | 相似度 |
|---|---|
| SciCode 与 HLE | 87.2% |
| Terminal-Bench 与 ALE 工程任务集 | 79.6% |
| 任意两个公开评测集(中位水平) | 56.0% |
本数据集与 Terminal-Bench 的相似度 67.5%, 明显高于任意两集的一般水平, 但低于上面两组同类集合之间 —— 也就是说它和终端型 agent 评测集属于近亲, 但不是同一种东西。结果稳定性指的是: 只有 8 道任务, 把它们有放回地重抽 2,000 次, 该集仍排第一的比例; 因此下面的判断同时用前两名, 不只看第一名。
由此推出的预期难度, 与实测对照
32.2% – 59.6%
最像的几个公开集里, 用百分比计分的有两个: Terminal-Bench 最好成绩 59.6%(逐题对错)、GDP.pdf 最好成绩 32.2%(一题的全部判据都过才算)。本数据集的判分是可执行验证加判据评审的混合并带封顶条款, 接近逐题对错, 因此预期通过率落在这个区间。
46%
本页 §1 的基线里表现最好的模型 pass@1 为 46%, 落在预期区间内、偏中低端。两点都指向低端且都成立: 其一, 本数据集对结果精度与自我验证的要求高于最相似的公开集; 其二, 这批基线用的是三个主流模型, 而各公开集的最好成绩来自当前最强的前沿模型 —— 换前沿模型来跑, 分数预计更高。
预期区间是在基线运行之前、仅凭能力需求标注推出的, 与实测过程互不相干; 实测结果落在区间内, 说明这套难度判断对本数据集是有效的。
能力覆盖对照
| 评测集 | 题数 | 重点考察的能力 | 知识深度 | 总体需求强度 | 该集公开最好成绩 |
|---|---|---|---|---|---|
| 本数据集 | 8 | 15/22 | 4.0 | 2.59 | — |
| Terminal-Bench | 66 | 16/22 | 4.24 | 2.46 | 59.6% |
| GDPval | 220 | 12/22 | 3.79 | 2.19 | 1735 Elo |
| GDP.pdf | 100 | 10/22 | 3.51 | 2.12 | 32.2% |
| ALE 工程任务集 | 139 | 14/22 | 4.27 | 2.26 | — |
| AutomationBench | 806 | 13/22 | 2.88 | 1.69 | 68.9% |
重点考察的能力指一半以上题目都要求达到较高水平的那些能力项, 数字越大说明一道题同时考的方面越多。本数据集为 15 项, 与 Terminal-Bench(16)、ALE 工程任务集(14)同级, 高于 GDPval(12)。本数据集尚未用前沿模型跑过完整榜单, 故最后一列留空。
补上了公开评测集的哪些空白
- 表达: 本数据集 7/8 道任务重点考察; 全部公开评测集里只有 1 个重点考察这一项, 最高为 GDPval 的 61%。
- 概念学习: 本数据集 6/8 道任务重点考察; 全部公开评测集里只有 1 个重点考察这一项, 最高为 Terminal-Bench 的 82%。
这两项是本数据集相对公开集合最实在的增量: 真实专家工作要求把结论写成可交付的产物(表达), 并在过程中形成原本不存在的新概念(概念学习) —— 而绝大多数公开评测集不考这两件事。
逐任务定位
| 任务 | 重点考察的能力 | 最相似的公开集题目来源(最近 15 道) | 通过 |
|---|---|---|---|
| 晶圆基板缺陷自动计数 | 21 | ALE 7、Terminal-Bench 6、GDPval 2 | 0/9 |
| CIS 视觉检测与打印联动 | 19 | Terminal-Bench 7、ALE 5、GDPval 2 | 0/9 |
| IMU 零偏在线学习状态机 | 17 | ALE 6、Terminal-Bench 6、GDPval 2 | 0/9 |
| 专业内容选题与创作工作流 | 15 | GDPval 9、AA-Briefcase 2、ALE 2 | 0/9 |
| 游戏引擎确定性模拟内核 | 14 | Terminal-Bench 9、ALE 5、AutomationBench 1 | 4/9 |
| 研发效能插件分析与仓库治理 | 13 | AutomationBench 7、GDPval 6、ALE 2 | 7/9 |
| 历史版本 CLI 工具架构调查 | 12 | AutomationBench 8、GDPval 5、ALE 1 | 9/9 |
| 量化交易系统演进规划 | 12 | GDPval 6、GDP.pdf 6、ALE 2 | 4/9 |
每道任务在题目层面找最接近的公开集题目, 括号内为最近 15 道题的来源分布。同时考察的能力越多, 通过次数越少。