难度是怎么量出来的
难度不是我们自己打的分, 而是把任务放到业界公开评测集中间做定位。本页讲清四件事: 拿什么来量、怎么标注、这些读数凭什么可信、各公开评测集的数值从哪来。
拿什么来量难度
先用一套公开的能力需求标准给每道任务逐项打分, 再把整个数据集和已有的公开评测集放在一起比较, 看它和谁最接近。不生造一个总分, 也不做跨项加权 —— 总分排名会随加权方式任意改变, 而「和谁最像」不会。
| 读数 | 怎么算 | 为什么这样算 |
|---|---|---|
| 重点考察的能力数 | 某项能力有一半以上题目要求达到较高水平(0–5 分里的 3 分及以上), 即算该集重点考察这一项; 统计这样的能力项个数 | 描述「考什么」要用占比而不是平均分 —— 只深考单一学科的集合, 平均分会被其他能力项稀释, 占比不会 |
| 知识深度 | 每题取 5 项知识类能力里的最高分, 再对全集取平均 | 知识按学科分流, 直接平均会把「只深考一科」的集合压低 |
| 总体需求强度 | 18 项核心能力需求的总平均分 | 不适合描述考什么, 但作为「总需求量」的粗略指标, 与实际难度的次序大体一致 |
| 相似度 | 先把高度相关的能力项合并, 再计算两个集合之间的整体差距, 换算成 0–100 的相似度; 另用一种对相关性更稳健的距离交叉验证 | 回答「和谁最像」。比自造一个综合复杂度总分稳健 —— 总分的排名取决于加权方式, 相似度不取决于 |
| 提升空间 | 100 减去该集的公开最好成绩(仅限百分比类计分) | 给难度加上刻度: 提升空间越大, 说明当前最强模型离做满还有多远 |
标注: ADeLe 需求能力项
ADeLe(Annotated Demand Levels)是一个公开的任务需求标注框架。它不跑模型、不改成绩, 而是给每道任务的每个需求能力项独立打 0–5 分, 回答「这道题要求多少注意力、推理、知识、规划、工具使用…」。共 27 项, 每项一份独立评分细则。
怎么打分
标注只看任务文本与该能力项的细则, 逐任务逐项独立评定。需求强度与题目对错无关, 也与谁来做无关。
怎么保证可比
每个参与对比的评测集都按统一格式打包(任务 + 输入清单 + 题面全文 + 交付物 + 判分方式), 用同一个模型、同一套细则标注。公开集取其公开发布的任务卡, 本数据集用实际交付的任务包内容。
能力项分四类
不是每一项都由任务包本身决定。标注体系把 27 项按来源分为四类, 读数时需区别对待 —— 下表列出。
| 类型 | 含义 |
|---|---|
| 固有 | 任务包本身决定, 换谁来做都一样 |
| 路线依赖 | 取决于解题路线与环境, 例如是否必须操作界面 |
| 答案依赖 | 取决于最终答案要用到什么, 只看题面是估计值 |
| 判分依赖 | 取决于判分方式, 需要任务包写明验收口径 |
这些读数凭什么可信
一套需求分若与模型的真实表现无关, 它就只是文字游戏。两条独立的对照表明方向是对的。
需求越高的公开评测集, 前沿模型剩的提升空间越大
把每个公开评测集的需求特征与它的提升空间做等级相关, 相关强度 0.5 以上的特征全部为正 —— 需求读数与实际难度的方向对得上。这是把需求读数当难度刻度用的前提。
| 需求特征 | 与提升空间的相关 |
|---|---|
| 精度要求 PR | +0.83 |
| 验证负担 VB | +0.77 |
| 总体需求强度 | +0.74 |
| 批判思维 MCt | +0.67 |
| 理解 CEc | +0.64 |
| 概念学习 CL | +0.64 |
样本只有 8 个公开评测集, 属探索性线索而非定论; 相关最高的精度要求与验证负担目前只有 6 个集有数据。
同一任务集内, 需求分高的档位成绩明显更低
在一个带逐题真实成绩的第三方工程任务集上, 11 个需求能力项与最佳成绩全部负相关, 没有一个正相关; 该集自带的三档难度里, 需求均值升高 20% 对应最佳成绩下降 59%。
| 难度档 | 需求均值 | 最佳成绩 |
|---|---|---|
| 近期档 | 2.48 | 0.881 |
| 全谱档 | 2.54 | 0.792 |
| 最难档 | 2.97 | 0.360 |
另一处互校: 在 Terminal-Bench 上, 人类专家估计耗时越长的任务, 标注给出的规划与精度需求也越高。
最直接的一次验证在 证据 · 这批任务有多难: 这套方法在基线运行之前就给出了本数据集的预期通过率区间, 实测结果落在区间内。
各公开评测集对照
题数、重点考察的能力数、知识深度、总体需求强度, 以及该集的公开最好成绩与提升空间。提升空间只在百分比计分的集合之间可比 —— Elo 类计分没有满分, 算不出提升空间。
| 评测集 | 题数 | 重点考察的能力数 | 知识深度 | 总体需求强度 | 公开最好成绩 | 提升空间 |
|---|---|---|---|---|---|---|
| 本数据集 | 8 | 15/22 | 4.0 | 2.59 | — | — |
| Terminal-Bench | 66 | 16/22 | 4.24 | 2.46 | 59.6% | 40 |
| ALE 工程集 | 139 | 14/22 | 4.27 | 2.26 | — | — |
| AA-Briefcase | 4 | 17/22 | 4.0 | 3.21 | 1678 Elo | — |
| GDPval | 220 | 12/22 | 3.79 | 2.19 | 1735 Elo | — |
| GDP.pdf | 100 | 10/22 | 3.51 | 2.12 | 32.2% | 68 |
| AutomationBench | 806 | 13/22 | 2.88 | 1.69 | 68.9% | 31 |
| CritPt | 70 | 11/22 | 5.0 | 2.59 | 32.3% | 68 |
| SciCode | 291 | 8/22 | 4.21 | 1.84 | 63.1% | 37 |
| AA-LCR | 100 | 8/22 | 2.32 | 1.72 | 88.7% | 11 |
逐项对照
本数据集与五个主要公开评测集的逐项平均分。● 表示本数据集重点考察该项(一半以上题目要求 ≥3 分); 每行最大值加粗。
| 能力项 | 名称与含义 | 类型 | 重点考察 | 本数据集 | Terminal-Bench | GDPval | GDP.pdf | ALE 工程集 | AutomationBench |
|---|---|---|---|---|---|---|---|---|---|
| AS | 注意与扫描 在信息流中定位关键元素 | 固有 | ● | 3.00 | 2.39 | 2.19 | 3.48 | 2.28 | 2.08 |
| CEc | 理解 文本与材料的理解要求 | 固有 | ● | 4.00 | 3.20 | 2.94 | 3.25 | 2.81 | 2.52 |
| CEe | 表达 把结论写成可交付的表达 | 固有 | ● | 3.25 | 1.12 | 2.58 | 1.98 | 1.32 | 1.68 |
| CL | 概念学习 边做边形成新概念 | 答案依赖 | ● | 3.12 | 3.04 | 1.49 | 1.19 | 1.71 | 1.03 |
| MCr | 元认知·识别 从材料中识别相关信息 | 答案依赖 | ● | 3.62 | 3.98 | 2.97 | 3.54 | 3.12 | 2.45 |
| MCt | 元认知·批判思维 过程中的批判与校准 | 答案依赖 | ● | 3.75 | 4.04 | 3.12 | 2.88 | 3.18 | 2.61 |
| MCu | 元认知·自知 判断自己是否掌握 | 答案依赖 | ● | 3.75 | 4.03 | 2.75 | 3.19 | 3.10 | 2.33 |
| MS | 心智模型 对他人意图的推断 | 固有 | 0.38 | 0.03 | 1.20 | 0.11 | 0.14 | 0.53 | |
| QLl | 逻辑 演绎推理 | 答案依赖 | ● | 3.25 | 3.91 | 2.06 | 2.20 | 2.90 | 2.43 |
| QLq | 定量 数值与计算 | 答案依赖 | 1.50 | 2.52 | 1.60 | 1.61 | 2.55 | 1.01 | |
| SNs | 空间 空间关系与物理直觉 | 固有 | 1.00 | 0.74 | 0.30 | 0.39 | 0.80 | 0.00 | |
| KNa | 应用知识 应用领域知识深度 | 答案依赖 | 2.62 | 1.79 | 3.50 | 3.32 | 3.32 | 2.03 | |
| KNc | 常识 常识深度 | 答案依赖 | 0.88 | 0.38 | 2.75 | 1.86 | 0.68 | 2.82 | |
| KNf | 形式知识 数学与形式系统 | 答案依赖 | 2.88 | 3.83 | 1.04 | 0.78 | 3.19 | 0.76 | |
| KNn | 自然科学 自然科学知识 | 答案依赖 | 0.50 | 0.76 | 0.42 | 0.96 | 1.55 | 0.00 | |
| KNs | 社会知识 社会与制度知识 | 答案依赖 | 0.50 | 0.24 | 0.94 | 0.50 | 0.29 | 0.09 | |
| AT | 非典型性 在常见语料中出现的可能性, 越罕见越高 | 固有 | ● | 4.50 | 4.23 | 3.78 | 3.61 | 3.87 | 3.49 |
| VO | 体量 胜任者完成所需时间 | 固有 | ● | 4.12 | 4.03 | 3.73 | 3.26 | 3.80 | 2.50 |
| PL | 规划 拆解与推进多步工作 | 路线依赖 | ● | 3.50 | 3.92 | 2.83 | 2.38 | 3.32 | 2.37 |
| SC | 规格遵从 按规定格式交付并自我验证 | 判分依赖 | ● | 3.75 | 4.03 | 3.13 | 1.45 | 3.56 | 3.16 |
| TU | 工具操作 命令行与专业软件操作 | 路线依赖 | 2.50 | 3.11 | 2.16 | 0.31 | 2.86 | 2.60 | |
| VI | 视觉/GUI 看图与操作界面 | 路线依赖 | 0.88 | 0.38 | 0.51 | 1.71 | 1.04 | 0.00 | |
| BP | 预算压力 时间与尝试次数约束 | 路线依赖 | 1.62 | 1.86 | 1.29 | 1.02 | 1.97 | 0.68 | |
| CS | 输出契约 交付形态的硬性要求 | 判分依赖 | ● | 3.50 | 3.26 | 2.95 | 0.76 | 3.35 | 3.38 |
| PR | 精度 容错空间大小 | 判分依赖 | ● | 2.62 | 3.68 | 2.32 | 2.66 | 2.97 | 2.25 |
| VB | 验证负担 需要多少独立判定 | 判分依赖 | ● | 3.88 | 3.35 | 3.69 | 3.65 | 3.49 | 2.96 |
| EV | 实证验证 必须实际运行才能确认 | 判分+路线 | 1.38 | 2.38 | 0.41 | 0.04 | 1.71 | 0.07 |