数据 · 专业Workspace数据 · 难度口径

难度是怎么量出来的

难度不是我们自己打的分, 而是把任务放到业界公开评测集中间做定位。本页讲清四件事: 拿什么来量、怎么标注、这些读数凭什么可信、各公开评测集的数值从哪来。

§ 1 · Metrics

拿什么来量难度

先用一套公开的能力需求标准给每道任务逐项打分, 再把整个数据集和已有的公开评测集放在一起比较, 看它和谁最接近。不生造一个总分, 也不做跨项加权 —— 总分排名会随加权方式任意改变, 而「和谁最像」不会。

读数怎么算为什么这样算
重点考察的能力数某项能力有一半以上题目要求达到较高水平(0–5 分里的 3 分及以上), 即算该集重点考察这一项; 统计这样的能力项个数描述「考什么」要用占比而不是平均分 —— 只深考单一学科的集合, 平均分会被其他能力项稀释, 占比不会
知识深度每题取 5 项知识类能力里的最高分, 再对全集取平均知识按学科分流, 直接平均会把「只深考一科」的集合压低
总体需求强度18 项核心能力需求的总平均分不适合描述考什么, 但作为「总需求量」的粗略指标, 与实际难度的次序大体一致
相似度先把高度相关的能力项合并, 再计算两个集合之间的整体差距, 换算成 0–100 的相似度; 另用一种对相关性更稳健的距离交叉验证回答「和谁最像」。比自造一个综合复杂度总分稳健 —— 总分的排名取决于加权方式, 相似度不取决于
提升空间100 减去该集的公开最好成绩(仅限百分比类计分)给难度加上刻度: 提升空间越大, 说明当前最强模型离做满还有多远
§ 2 · Annotation

标注: ADeLe 需求能力项

ADeLe(Annotated Demand Levels)是一个公开的任务需求标注框架。它不跑模型、不改成绩, 而是给每道任务的每个需求能力项独立打 0–5 分, 回答「这道题要求多少注意力、推理、知识、规划、工具使用…」。共 27 项, 每项一份独立评分细则。

01

怎么打分

标注只看任务文本与该能力项的细则, 逐任务逐项独立评定。需求强度与题目对错无关, 也与谁来做无关。

02

怎么保证可比

每个参与对比的评测集都按统一格式打包(任务 + 输入清单 + 题面全文 + 交付物 + 判分方式), 用同一个模型、同一套细则标注。公开集取其公开发布的任务卡, 本数据集用实际交付的任务包内容。

03

能力项分四类

不是每一项都由任务包本身决定。标注体系把 27 项按来源分为四类, 读数时需区别对待 —— 下表列出。

类型含义
固有任务包本身决定, 换谁来做都一样
路线依赖取决于解题路线与环境, 例如是否必须操作界面
答案依赖取决于最终答案要用到什么, 只看题面是估计值
判分依赖取决于判分方式, 需要任务包写明验收口径
§ 3 · Validity

这些读数凭什么可信

一套需求分若与模型的真实表现无关, 它就只是文字游戏。两条独立的对照表明方向是对的。

对照一

需求越高的公开评测集, 前沿模型剩的提升空间越大

把每个公开评测集的需求特征与它的提升空间做等级相关, 相关强度 0.5 以上的特征全部为正 —— 需求读数与实际难度的方向对得上。这是把需求读数当难度刻度用的前提。

需求特征与提升空间的相关
精度要求 PR+0.83
验证负担 VB+0.77
总体需求强度+0.74
批判思维 MCt+0.67
理解 CEc+0.64
概念学习 CL+0.64

样本只有 8 个公开评测集, 属探索性线索而非定论; 相关最高的精度要求与验证负担目前只有 6 个集有数据。

对照二

同一任务集内, 需求分高的档位成绩明显更低

在一个带逐题真实成绩的第三方工程任务集上, 11 个需求能力项与最佳成绩全部负相关, 没有一个正相关; 该集自带的三档难度里, 需求均值升高 20% 对应最佳成绩下降 59%。

难度档需求均值最佳成绩
近期档2.480.881
全谱档2.540.792
最难档2.970.360

另一处互校: 在 Terminal-Bench 上, 人类专家估计耗时越长的任务, 标注给出的规划与精度需求也越高。

最直接的一次验证在 证据 · 这批任务有多难: 这套方法在基线运行之前就给出了本数据集的预期通过率区间, 实测结果落在区间内。

§ 4 · Benchmarks

各公开评测集对照

题数、重点考察的能力数、知识深度、总体需求强度, 以及该集的公开最好成绩与提升空间。提升空间只在百分比计分的集合之间可比 —— Elo 类计分没有满分, 算不出提升空间。

评测集题数重点考察的能力数知识深度总体需求强度公开最好成绩提升空间
本数据集815/224.02.59
Terminal-Bench6616/224.242.4659.6%40
ALE 工程集13914/224.272.26
AA-Briefcase417/224.03.211678 Elo
GDPval22012/223.792.191735 Elo
GDP.pdf10010/223.512.1232.2%68
AutomationBench80613/222.881.6968.9%31
CritPt7011/225.02.5932.3%68
SciCode2918/224.211.8463.1%37
AA-LCR1008/222.321.7288.7%11
§ 5 · By ability

逐项对照

本数据集与五个主要公开评测集的逐项平均分。● 表示本数据集重点考察该项(一半以上题目要求 ≥3 分); 每行最大值加粗。

能力项名称与含义类型重点考察本数据集Terminal-BenchGDPvalGDP.pdfALE 工程集AutomationBench
AS注意与扫描
在信息流中定位关键元素
固有3.002.392.193.482.282.08
CEc理解
文本与材料的理解要求
固有4.003.202.943.252.812.52
CEe表达
把结论写成可交付的表达
固有3.251.122.581.981.321.68
CL概念学习
边做边形成新概念
答案依赖3.123.041.491.191.711.03
MCr元认知·识别
从材料中识别相关信息
答案依赖3.623.982.973.543.122.45
MCt元认知·批判思维
过程中的批判与校准
答案依赖3.754.043.122.883.182.61
MCu元认知·自知
判断自己是否掌握
答案依赖3.754.032.753.193.102.33
MS心智模型
对他人意图的推断
固有0.380.031.200.110.140.53
QLl逻辑
演绎推理
答案依赖3.253.912.062.202.902.43
QLq定量
数值与计算
答案依赖1.502.521.601.612.551.01
SNs空间
空间关系与物理直觉
固有1.000.740.300.390.800.00
KNa应用知识
应用领域知识深度
答案依赖2.621.793.503.323.322.03
KNc常识
常识深度
答案依赖0.880.382.751.860.682.82
KNf形式知识
数学与形式系统
答案依赖2.883.831.040.783.190.76
KNn自然科学
自然科学知识
答案依赖0.500.760.420.961.550.00
KNs社会知识
社会与制度知识
答案依赖0.500.240.940.500.290.09
AT非典型性
在常见语料中出现的可能性, 越罕见越高
固有4.504.233.783.613.873.49
VO体量
胜任者完成所需时间
固有4.124.033.733.263.802.50
PL规划
拆解与推进多步工作
路线依赖3.503.922.832.383.322.37
SC规格遵从
按规定格式交付并自我验证
判分依赖3.754.033.131.453.563.16
TU工具操作
命令行与专业软件操作
路线依赖2.503.112.160.312.862.60
VI视觉/GUI
看图与操作界面
路线依赖0.880.380.511.711.040.00
BP预算压力
时间与尝试次数约束
路线依赖1.621.861.291.021.970.68
CS输出契约
交付形态的硬性要求
判分依赖3.503.262.950.763.353.38
PR精度
容错空间大小
判分依赖2.623.682.322.662.972.25
VB验证负担
需要多少独立判定
判分依赖3.883.353.693.653.492.96
EV实证验证
必须实际运行才能确认
判分+路线1.382.380.410.041.710.07
想看每道任务的逐维分数?样本集内每道任务附完整元数据
申请样本

数据受样本评估许可约束(30 天 · 仅限评估)联系商务 · 申请样本最后更新 2026-09-19