AI 能力边界 · 2026-09-12

ALE 任务的认知需求画像与当前 agent 的能力边界

面向"agent 在哪些能力上最欠缺、改进什么最能提升专业任务基准"这个问题,把 Agents’ Last Exam 的 139 个公开任务当作 ADeLe 的 custom benchmark:用 18 个原始维度加 9 个补充维度标注每个任务的需求等级,再从需求侧和结果侧两个方向分析 claude-code / opus-4.8 与 codex / gpt-5.5 的失败模式,最后给出有统计支持、有代表性案例的改进方向。

范宽《溪山行旅图》轴(局部)· 台北故宫博物院藏

摘要 #

  1. ALE 考什么。几乎每个任务在相关信息识别、批判性思维、校准、逻辑推理、工作量、规格合规上都是 3 到 4 级;心智建模、社科知识、语言表达基本不考;视觉/GUI、空间推理、自然科学只在约一半任务出现。
  2. 难度分层有认知基础。ALE 作者把任务分成 near-term、full-spectrum、last-exam 三个由易到难的层;把这三层记作 0、1、2(下文的 tier 秩),综合需求因子与它的 Spearman ρ = 0.47(p < 0.0001)。最对齐的维度是规划长程(0.43)、相关信息识别、校准、工作量、工具操作,而不是知识广度。补充的 PL、TU 两维进入前五。
  3. agent 的失败随任务的整体需求上升,而不是随某个维度。任务在核心六维(PL、AS、CL、MCu、MCr、VO)上的等级高度同步(两两相关 0.4 到 0.7):把各维等级标准化后取平均得到一个“整体需求”因子,它与通过率显著相关;扣除这个因子的影响之后,每一维与通过率的剩余相关都接近 0。数据支持“任务越重 agent 越容易失败”,不支持“agent 在某一维特别弱”,能力雷达图上各维度之间的形状差异因此不可解读,只有总体大小有意义。
  4. 结果侧用两个视角看同一批失败:agent 自己的叙述,和第三方对完整轨迹的审计。前者是 agent 认为自己做了什么、达到了什么;后者由判分模型逐步核对 154 个运行的 shell 命令与返回、文件读写、GUI 动作(带步骤号)。两个视角对失败主因的一致率 69%,分歧本身是信息:两个 agent 的 72 个失败里,61% 是流程走完但方法或精度不达标;36% 以一句轨迹不支持的“已完成 / 已验证”结束(opus-4.8 23/51,gpt-5.5 3/21),最终断言无据的运行通过率为 0,有据的为 51%;在有可核验抓手的 51 个失败里 21 个没有用这些抓手。
  5. 缺的能力多数是领域通用技能,不是领域知识。对 67 个失败运行逐一回答“若改进哪项能力最可能翻转这次运行”,归成 8 个主题后,55 个是领域通用技能(实证调参与样本外验证、独立实证核验、规则与定义的字面忠实、契约自审、预算节奏、视觉空间感知),只有 12 个是领域专属知识或专业工具链。这与需求侧一致:知识类维度与分层和成败都不相关,相关的都是规划、校准、信息处理这类过程性维度。领域通用技能跨领域迁移,改进一次抬高多个领域;领域知识只能逐领域补。EV(实证验证需求)就是为最大的那个主题定义的任务侧维度,过程纪律则要在 agent 侧度量。
  6. 每个维度在需求侧和结果侧的结论并排见 3.8 节的总表和图 12。11 个维度与成败显著相关,控制综合因子后仍有信号的只有 1 个;能分出具体失败类型的维度都来自结果侧驱动的那一批。
  7. 三个改进方向按投入产出比排序,其中最便宜的一项常被低估。过程纪律:26 个失败以无据断言结束、21 个没有用任务提供的抓手,这些运行的工作已经完成,缺的只是核验和如实报告,修复它不需要新能力,上限 +14 pp(opus-4.8)。预算节奏:opus-4.8 独有的 7 个失败几乎全是 0 分,修法是先交一份合法的部分产出。实证调参与样本外验证:44 个失败流程走完但精度不达标,上限 +33 到 +46 pp,是最大的池子,且是领域通用、可训练的。4.5 节按能力和按领域两个维度给出分解。
139
公开任务变体(12 个领域)
27
任务侧维度 = 18 ADeLe + 4 agentic + 5 结果侧驱动
3,132
LLM 判分调用,100% 有效
81 / 37
有结果的任务:opus-4.8 / gpt-5.5
154
逐步审计的完整轨迹
37% / 43%
最佳运行通过率

背景与目的 #

Agent 已经能够执行相当多样的专业工作:写代码和修复缺陷、操作办公软件和桌面应用、跑科学计算和数据分析流水线、做金融和法律文书。与之相应,面向专业场景、经济价值高的任务类型的基准也越来越多,覆盖软件工程、计算机使用、科研复现、金融法律等方向。这些基准的作用是给出不同模型在某个垂直场景或某类能力上的绝对水平和相对排名,这对选型和进度跟踪已经足够。

但对改进 agent 来说还不够。我们还希望知道更细粒度的能力维度上 agent 的表现:一个 60% 的通过率里,失败的 40% 是因为规划不够长、领域知识不够深、还是交付前没有核验?只有回答了这个问题,才能有针对性地优化表现不佳的能力维度,并预期它能把相应基准的指标抬高多少。当前多数基准只报告一个分数,agent 在其上的表现缺乏直观的、定量的分析,也没有给出明确的能力改进方向。

因此本文选择一个领域和场景覆盖相对广、任务有挑战性的数据集做深入分析:Agents' Last Exam 的 139 个公开任务横跨 12 个领域、49 个子领域,任务是真实的专业工作,前沿 agent 的通过率不到一半。分析框架用 ADeLe(Zhou et al., Nature 2026):它把每个任务标注成若干认知需求维度上的等级,把"任务要求什么"和"agent 做得到什么"分开度量,天然适合回答细粒度能力的问题。在此基础上做了两处扩展:一是按 agent 任务的特点补充了原框架没有的维度;二是在需求侧的相关分析之外,增加了对每个失败运行的结果侧归因,并把两条证据链交叉印证。最终产出是几个有统计支持、有代表性案例、能估计收益上限的改进方向。

1ALE 任务的背景与情况 #

1.1ALE 是什么

Agents' Last Exam(ALE)由 UC Berkeley RDI 主导,目标是用经济上有价值、结果可验证的长程真实工作评测前沿 agent 系统。任务按 O*NET / SOC 职业分类组织成 13 个行业簇、55 个子领域,由行业专家提供并验证。公开仓库带约 150 个任务和 ale_run 框架:一次实验是"一个 agent harness × 一个环境 × 一个任务",框架负责开沙箱、注入输入、让 agent 自主跑到结束、再注入隐藏参考并评分。

与问答式基准的关键差别有三点。第一,评测对象是完整的 harness(Claude Code、Codex、Openclaw 等),不是被逐步操控的模型;ALE 只给任务描述,把终端和桌面 GUI 一并交给 agent。第二,环境是装有真实专业软件的 Windows 或 Ubuntu 虚拟机,任务数据是真实文件。第三,评分看留在 output/ 里的产物,用隐藏参考做确定性比对,分数在 [0, 1]。

1.2任务包与评分

一个任务是 tasks/<domain>/<task>/main.pytask_card.jsonmain.py 有三个钩子:load() 声明任务和变体(含给 agent 的任务描述),start() 在沙箱里准备工作区,evaluate() 在 agent 结束后读取产物和参考并返回分数。数据在 ale-tasks-data/<domain>/<task>/<variant>/ 下分三类:input/ 对 agent 可见,software/ 是启动器和运行时,reference/ 是隐藏参考,只在评分阶段注入。

评分器有两个反复出现的特征,后面的分析会不断回到它们。一是硬门槛:文件缺失、多出文件、schema 或表头不对、编码不对,整份或整个子任务直接 0 分。二是分层部分得分:很多任务分 Tier 1/2/3 或按子任务给分,所以 [0, 1] 之间的分数很常见,全部 157 条结果里 65 条是部分得分。本文沿用 ALE 自己的规则,把 score == 1.0 记为通过,另做一个保留部分得分的软标签版本。

1.3本文覆盖的任务集

ALE 公开的任务数据有 144 个变体,去掉 5 个 demo 后 139 个进入分析,每个变体是 ADeLe 意义上的一个实例。ALE 的 selected_tasks/full/ 把任务分成三个难度层:near-term 60 个、full-spectrum 46 个、last-exam 32 个(1 个未分层)。操作系统 Ubuntu 105 个、Windows 34 个;6 个任务需要 GPU;单任务墙钟预算中位数 2 小时、最长 8 小时。输入体量差异极大:文件数中位数 6、最多 41,771,大小中位数 1.2 MB、最大 13 GB。软件以 Python 数据栈为主(Python 93 个任务、pandas 28、NumPy 25、PyTorch 8、R 7),专业软件覆盖 KiCad、Blender、MicroDicom、matRad、OpenROAD、Amber、PLAXIS、Ghidra 等。

医疗健康 (health_medicine)医疗健康: 26 个任务26计算与数学 (computing_math)计算与数学: 23 个任务23商业金融 (business_finance)商业金融: 21 个任务21工程 (engineering)工程: 20 个任务20生命科学 (life_sciences)生命科学: 19 个任务19物理科学 (physical_sciences)物理科学: 15 个任务15教育信息 (education_info)教育信息: 4 个任务4心理神经 (psychology_neuro)心理神经: 3 个任务3交通安全 (transport_safety)交通安全: 3 个任务3法律 (legal)法律: 2 个任务2其他 (other)其他: 2 个任务2社会科学 (social_sciences)社会科学: 1 个任务1
图 1 任务按领域的分布。医疗健康、计算与数学、商业金融、工程、生命科学五个领域占 78%;法律、社会科学、心理神经等领域样本极少,领域层面的比较只对前六个领域有意义。

1.4已有的运行结果

能力分析用的是 ALE 公开运行轨迹(ale-traces)里的两类记录:151 个任务各一条"最佳运行"(walkthrough)和 13 个任务的 Codex 与 Claude Code 对照运行。ALE leaderboard 不提供完整的 agent × task 矩阵。按轨迹数取前两个 agent:claude-code / opus-4.8 覆盖 81 个任务、通过 30 个(37%,平均分 0.61);codex / gpt-5.5 覆盖 37 个、通过 16 个(43%,平均分 0.70)。

标签的选择偏差必须先说明。walkthrough 只保留每个任务表现最好的那次运行,某个 agent 出现在某个任务上,往往意味着它在那个任务上赢了别的 agent。因此两个 agent 的任务子集都不是随机的,通过率偏高,两者之间的差异不可直接比较。本文所有能力数字都在这个前提下解读。

claude-code / opus-4.8codex / gpt-5.5
0%25%50%75%100%claude-code / opus-4.8 · near-term: 18/35 通过51%codex / gpt-5.5 · near-term: 9/17 通过53%near-termclaude-code / opus-4.8 · full-spectrum: 11/31 通过35%codex / gpt-5.5 · full-spectrum: 6/10 通过60%full-spectrumclaude-code / opus-4.8 · last-exam: 1/15 通过7%codex / gpt-5.5 · last-exam: 1/10 通过10%last-exam
图 2 两个 agent 在三个难度层上的通过率。near-term 到 last-exam 的通过率从五成左右跌到一成,与 ALE 作者的分层意图一致。悬停可见通过数与任务数。

2ALE 任务的 ADeLe 分析 #

2.1方法

ADeLe 的核心不变量是需求描述任务,不描述作答:每个 rubric 定义 0 到 5 级,由 LLM judge 阅读任务实例后给出一个整数等级,与任何模型的表现无关。把 ALE 接进这套流程需要解决"任务实例是什么":ALE 的任务描述大多是"读 problem_spec.md",需求量藏在输入文档里。本文给 judge 的实例文本由 task_card.json 的标题、摘要、给 agent 的指令、必做事项和软件环境组成,再拼上 input/ 目录清单和顶层规格文档(截断到 16k 字符),不含隐藏参考,也不含 task_card 的 inputFiles 描述字段。实例文本中位数约 1.4k token。

判分模型是 claude-opus-5,以无工具、最小系统提示的方式逐对调用,139 × 22 = 3132 次,全部解析有效,单次中位 82 秒。两个药物化学 SMILES 抽取任务(37 对)被 Opus 5 的安全过滤确定性拦截,改由 claude-sonnet-5 判分。ADeLe 的不可猜测性维度 UG 由作答形式决定,ALE 全是开放式产物任务,统一取 100。

2.2补充维度:4 个 agentic + 5 个结果侧驱动

ADeLe v1 的 18 个维度为问答任务设计,没有覆盖 agent 任务特有的需求。本文补了 9 个任务侧维度,分两组,格式与原 rubric 一致(0 到 5 级各配三个示例,通过 ADeLe 的 rubric 校验),本章所有图表按三组着色:

ADeLe v1 原维度(18)agentic 补充(4)结果侧驱动补充(5)

agentic 补充(4 个):按 ALE 任务的形态补上工具操作、长程规划、视觉与 GUI、规格合规四类需求。

TU 工具与软件操作
命令行、运行时、包管理、专业软件(CAD/EDA/DICOM/MD 流水线)的安装、配置、串联与排障;不含解释结果所需的领域知识。
PL 规划与长程执行
把目标拆成相互依赖的阶段、自行选择路线、检查中间产物并调整、在没有外部反馈的长时间运行中跟踪进度和恢复失败。
VI 视觉感知与 GUI 交互
读图、读屏、判读图纸和医学影像,以及在图形界面里定位控件、点击、拖拽、从画布推断状态。
SC 规格合规与自检
精确的输出契约(文件名、schema、编码、容差、硬门槛)以及在无反馈条件下自行核验产物是否满足契约的要求。

结果侧驱动补充(5 个):动机来自第 3 章的失败归因,它显示相当一部分失败落在原有画像之外(做完了但精度不达标、做完了但没核验、契约写错、预算耗尽),为了让这些失败能指向体系内的维度,又不违反“维度描述任务而不描述作答”的不变量,把它们各自对应的任务侧属性写成 rubric;EV 来自 3.7 节对缺失能力主题的归纳。这批维度的标注在实例文本后附上评分规则,因为通过标准是任务需求的一部分,即便 agent 看不到它。

CS 输出契约严格度
有多少精确条件必须同时成立、是否有一票否决的硬门槛、是否惩罚多余内容。对应契约违规和漏读规格。
PR 精度要求
隐藏参考的容差相对“胜任但非专家的标准方法”能达到的水平有多紧。对应领域方法 / 精度不达标。
VB 自检负担
任务给了多少可核验的抓手(可见参考值、测试、可校验的中间结果),通过标准藏得多深。对应未验证即宣称完成。
BP 预算压力
计算与等待、条目规模相对固定会话预算的紧张程度,能否分段交付。对应规划 / 预算耗尽。
EV 实证验证需求
达标需要多少轮实证迭代:选模型、调参、收敛、用留出集 / 回测 / 收敛性研究判断何时达标。对应实证调参与样本外验证。

2.3各维度的等级分布

等级的含义。每个维度的 rubric 把需求分成 0 到 5 级:0 级是这个维度完全用不上,5 级是一个完全胜任的人也要动用该维度最高水平的能力。等级描述的是任务对“一个有充分知识、工具和技能的人”的要求,与哪个 agent 来做无关。各维度的 5 级各有具体定义:工作量 VO 按人完成任务的时间分档(1 级 1 分钟以内,3 级 10 到 100 分钟,5 级超过 16 小时);知识类维度按所需教育程度分档(1 级常识,3 级本科,5 级研究前沿);推理和元认知类维度按推理链的长度和不确定性分档。等级是序数不是等距:从 3 级到 4 级和从 1 级到 2 级不是“同样多”的增量。

怎么读图 3。一行一个维度,横条按 0 到 5 级任务的占比切段,颜色越深等级越高,右端是均值。一行几乎全是深色说明这个维度是 ALE 普遍的高要求;一行以最浅的 0 级为主说明 ALE 几乎不考它;一行从浅到深都有说明这个维度能把任务区分开,这种维度在后面的成败分析里才有用。左侧色块是维度分组,横线分隔三组。

139 个任务在 27 个维度上的分布里,原维度三类一目了然。高而均匀的一类:MCr、MCt、MCu、QLl、VO、SC、AS、CEc、AT、KNf 有 78% 以上的任务落在 3 到 4 级,VO 没有任何任务低于 3 级。几乎不考的一类:MS 有 76% 的任务为 0 级,KNs 70%,CEe 几乎全在 1 级。两极分化的一类:VI、SNs、KNn 各有约一半任务为 0 级,另一半集中在 3 到 4 级,对应有无影像、几何或自然科学内容的任务子集。补充维度里,PL、TU、PR、BP、EV 的分布展开了(EV 标准差 1.13,BP 和 PR 0.93),VI 两极分化,SC 和 CS 像原维度一样挤在 3 到 4 级。

ADeLe v1 原维度(18)agentic 补充(4)结果侧驱动补充(5)
L0L1L2L3L4L5均值AS 注意与扫描AS 注意与扫描 · L2: 10 个任务 (7%)AS 注意与扫描 · L3: 94 个任务 (68%)AS 注意与扫描 · L4: 34 个任务 (24%)AS 注意与扫描 · L5: 1 个任务 (1%)3.19CEc 语言理解CEc 语言理解 · L2: 11 个任务 (8%)CEc 语言理解 · L3: 90 个任务 (65%)CEc 语言理解 · L4: 37 个任务 (27%)CEc 语言理解 · L5: 1 个任务 (1%)3.20CEe 语言表达CEe 语言表达 · L0: 3 个任务 (2%)CEe 语言表达 · L1: 95 个任务 (68%)CEe 语言表达 · L2: 26 个任务 (19%)CEe 语言表达 · L3: 14 个任务 (10%)CEe 语言表达 · L4: 1 个任务 (1%)1.39CL 概念化与抽象CL 概念化与抽象 · L1: 12 个任务 (9%)CL 概念化与抽象 · L2: 51 个任务 (37%)CL 概念化与抽象 · L3: 64 个任务 (46%)CL 概念化与抽象 · L4: 12 个任务 (9%)2.55MCr 相关信息识别MCr 相关信息识别 · L2: 2 个任务 (1%)MCr 相关信息识别 · L3: 69 个任务 (50%)MCr 相关信息识别 · L4: 64 个任务 (46%)MCr 相关信息识别 · L5: 4 个任务 (3%)3.50MCt 批判性思维MCt 批判性思维 · L2: 4 个任务 (3%)MCt 批判性思维 · L3: 61 个任务 (44%)MCt 批判性思维 · L4: 73 个任务 (53%)MCt 批判性思维 · L5: 1 个任务 (1%)3.51MCu 已知未知校准MCu 已知未知校准 · L2: 5 个任务 (4%)MCu 已知未知校准 · L3: 83 个任务 (60%)MCu 已知未知校准 · L4: 50 个任务 (36%)MCu 已知未知校准 · L5: 1 个任务 (1%)3.34MS 心智建模MS 心智建模 · L0: 105 个任务 (76%)MS 心智建模 · L1: 26 个任务 (19%)MS 心智建模 · L2: 6 个任务 (4%)MS 心智建模 · L3: 2 个任务 (1%)0.32QLl 逻辑推理QLl 逻辑推理 · L1: 2 个任务 (1%)QLl 逻辑推理 · L2: 6 个任务 (4%)QLl 逻辑推理 · L3: 63 个任务 (45%)QLl 逻辑推理 · L4: 64 个任务 (46%)QLl 逻辑推理 · L5: 4 个任务 (3%)3.45QLq 定量推理QLq 定量推理 · L1: 14 个任务 (10%)QLq 定量推理 · L2: 33 个任务 (24%)QLq 定量推理 · L3: 42 个任务 (30%)QLq 定量推理 · L4: 41 个任务 (29%)QLq 定量推理 · L5: 9 个任务 (6%)2.99SNs 空间物理推理SNs 空间物理推理 · L0: 52 个任务 (37%)SNs 空间物理推理 · L1: 36 个任务 (26%)SNs 空间物理推理 · L2: 13 个任务 (9%)SNs 空间物理推理 · L3: 26 个任务 (19%)SNs 空间物理推理 · L4: 6 个任务 (4%)SNs 空间物理推理 · L5: 6 个任务 (4%)1.40KNa 应用科学知识KNa 应用科学知识 · L0: 14 个任务 (10%)KNa 应用科学知识 · L1: 8 个任务 (6%)KNa 应用科学知识 · L2: 7 个任务 (5%)KNa 应用科学知识 · L3: 19 个任务 (14%)KNa 应用科学知识 · L4: 73 个任务 (53%)KNa 应用科学知识 · L5: 18 个任务 (13%)3.32KNc 日常常识KNc 日常常识 · L0: 2 个任务 (1%)KNc 日常常识 · L1: 77 个任务 (55%)KNc 日常常识 · L2: 43 个任务 (31%)KNc 日常常识 · L3: 16 个任务 (12%)KNc 日常常识 · L4: 1 个任务 (1%)1.55KNf 形式科学知识KNf 形式科学知识 · L1: 2 个任务 (1%)KNf 形式科学知识 · L2: 16 个任务 (12%)KNf 形式科学知识 · L3: 39 个任务 (28%)KNf 形式科学知识 · L4: 69 个任务 (50%)KNf 形式科学知识 · L5: 13 个任务 (9%)3.54KNn 自然科学知识KNn 自然科学知识 · L0: 55 个任务 (40%)KNn 自然科学知识 · L1: 16 个任务 (12%)KNn 自然科学知识 · L2: 11 个任务 (8%)KNn 自然科学知识 · L3: 14 个任务 (10%)KNn 自然科学知识 · L4: 34 个任务 (24%)KNn 自然科学知识 · L5: 9 个任务 (6%)1.88KNs 社科人文知识KNs 社科人文知识 · L0: 97 个任务 (70%)KNs 社科人文知识 · L1: 16 个任务 (12%)KNs 社科人文知识 · L2: 8 个任务 (6%)KNs 社科人文知识 · L3: 11 个任务 (8%)KNs 社科人文知识 · L4: 6 个任务 (4%)KNs 社科人文知识 · L5: 1 个任务 (1%)0.68AT 非典型性AT 非典型性 · L2: 11 个任务 (8%)AT 非典型性 · L3: 93 个任务 (67%)AT 非典型性 · L4: 35 个任务 (25%)3.17VO 工作量VO 工作量 · L3: 52 个任务 (37%)VO 工作量 · L4: 76 个任务 (55%)VO 工作量 · L5: 11 个任务 (8%)3.71TU 工具与软件操作TU 工具与软件操作 · L1: 5 个任务 (4%)TU 工具与软件操作 · L2: 50 个任务 (36%)TU 工具与软件操作 · L3: 55 个任务 (40%)TU 工具与软件操作 · L4: 24 个任务 (17%)TU 工具与软件操作 · L5: 5 个任务 (4%)2.81PL 规划与长程执行PL 规划与长程执行 · L2: 29 个任务 (21%)PL 规划与长程执行 · L3: 74 个任务 (53%)PL 规划与长程执行 · L4: 34 个任务 (24%)PL 规划与长程执行 · L5: 2 个任务 (1%)3.06VI 视觉感知与 GUIVI 视觉感知与 GUI · L0: 74 个任务 (53%)VI 视觉感知与 GUI · L1: 29 个任务 (21%)VI 视觉感知与 GUI · L2: 5 个任务 (4%)VI 视觉感知与 GUI · L3: 13 个任务 (9%)VI 视觉感知与 GUI · L4: 17 个任务 (12%)VI 视觉感知与 GUI · L5: 1 个任务 (1%)1.09SC 规格合规与自检SC 规格合规与自检 · L2: 6 个任务 (4%)SC 规格合规与自检 · L3: 65 个任务 (47%)SC 规格合规与自检 · L4: 63 个任务 (45%)SC 规格合规与自检 · L5: 5 个任务 (4%)3.48CS 输出契约严格度CS 输出契约严格度 · L2: 9 个任务 (6%)CS 输出契约严格度 · L3: 31 个任务 (22%)CS 输出契约严格度 · L4: 92 个任务 (66%)CS 输出契约严格度 · L5: 7 个任务 (5%)3.70PR 精度要求PR 精度要求 · L1: 5 个任务 (4%)PR 精度要求 · L2: 23 个任务 (17%)PR 精度要求 · L3: 65 个任务 (47%)PR 精度要求 · L4: 35 个任务 (25%)PR 精度要求 · L5: 11 个任务 (8%)3.17VB 自检负担VB 自检负担 · L1: 1 个任务 (1%)VB 自检负担 · L2: 17 个任务 (12%)VB 自检负担 · L3: 29 个任务 (21%)VB 自检负担 · L4: 85 个任务 (61%)VB 自检负担 · L5: 7 个任务 (5%)3.58BP 预算压力BP 预算压力 · L1: 67 个任务 (48%)BP 预算压力 · L2: 45 个任务 (32%)BP 预算压力 · L3: 18 个任务 (13%)BP 预算压力 · L4: 8 个任务 (6%)BP 预算压力 · L5: 1 个任务 (1%)1.78EV 实证验证需求EV 实证验证需求 · L0: 16 个任务 (12%)EV 实证验证需求 · L1: 58 个任务 (42%)EV 实证验证需求 · L2: 34 个任务 (24%)EV 实证验证需求 · L3: 20 个任务 (14%)EV 实证验证需求 · L4: 10 个任务 (7%)EV 实证验证需求 · L5: 1 个任务 (1%)1.66
图 3 27 个任务侧维度上 0 到 5 级任务的占比(同一蓝色由浅到深表示等级升高),右侧为均值,左侧色块为维度分组,横线分隔三组。悬停任一段可见任务数。5 级在原 22 维的 3,058 个标注里只出现 92 次。

2.4需求与难度分层

ALE 的作者把任务分成三个难度层:near-term 是预期近期就能被 agent 解决的任务,full-spectrum 是中间的主体,last-exam 是预期最后才会被攻克的任务。这个划分是作者的主观判断,需求标注给出了独立的检验。做法是把三层按由易到难记作 0、1、2,称为 tier 秩,然后计算每个维度的等级与 tier 秩的 Spearman 秩相关:ρ 为正表示作者认为越难的任务在这个维度上的需求也越高,ρ 接近 0 表示这个维度与作者的难度判断无关。22 个原维度的标准化均值(综合需求因子)与 tier 秩的 ρ = 0.47,p < 0.0001。逐维看,与分层最对齐的是 PL(0.43)、MCr(0.34)、VO(0.32)、MCu(0.32)、TU(0.30)、CL(0.29),全部 p < 0.01;知识类维度 KNf、KNn、KNs、KNc 和 CEe、MS 与分层无关。也就是说,ALE 作者心目中的"难"是规划跨度、信息筛选、校准和工作量,不是知识广度。补充的 PL 是与 tier 最对齐的单一维度,TU 排第五,说明它们捕捉到了 18 个原维度没覆盖的东西;不过 PL 与核心维度的相关在 0.4 到 0.7 之间,并非完全独立。结果侧驱动的五个里,BP(+0.32)、PR(+0.23)、EV(+0.23)与分层显著相关,CS 和 VB 不相关:契约的严格和抓手的多少不随难度层变化。

p < 0.01p < 0.05不显著
ADeLe v1 原维度(18)agentic 补充(4)结果侧驱动补充(5)
-0.1+0.0+0.1+0.2+0.3+0.4+0.5PL 规划与长程执行PL 规划与长程执行: Spearman ρ = 0.43, p = 0.000MCr 相关信息识别MCr 相关信息识别: Spearman ρ = 0.34, p = 0.000VO 工作量VO 工作量: Spearman ρ = 0.32, p = 0.000BP 预算压力BP 预算压力: Spearman ρ = 0.32, p = 0.000MCu 已知未知校准MCu 已知未知校准: Spearman ρ = 0.32, p = 0.000TU 工具与软件操作TU 工具与软件操作: Spearman ρ = 0.30, p = 0.000CL 概念化与抽象CL 概念化与抽象: Spearman ρ = 0.29, p = 0.000MCt 批判性思维MCt 批判性思维: Spearman ρ = 0.28, p = 0.001SNs 空间物理推理SNs 空间物理推理: Spearman ρ = 0.28, p = 0.001KNa 应用科学知识KNa 应用科学知识: Spearman ρ = 0.26, p = 0.002AS 注意与扫描AS 注意与扫描: Spearman ρ = 0.26, p = 0.002AT 非典型性AT 非典型性: Spearman ρ = 0.24, p = 0.005EV 实证验证需求EV 实证验证需求: Spearman ρ = 0.23, p = 0.006SC 规格合规与自检SC 规格合规与自检: Spearman ρ = 0.23, p = 0.006PR 精度要求PR 精度要求: Spearman ρ = 0.23, p = 0.007QLl 逻辑推理QLl 逻辑推理: Spearman ρ = 0.22, p = 0.011QLq 定量推理QLq 定量推理: Spearman ρ = 0.19, p = 0.022VI 视觉感知与 GUIVI 视觉感知与 GUI: Spearman ρ = 0.16, p = 0.065CEc 语言理解CEc 语言理解: Spearman ρ = 0.16, p = 0.068KNf 形式科学知识KNf 形式科学知识: Spearman ρ = 0.13, p = 0.128KNc 日常常识KNc 日常常识: Spearman ρ = 0.11, p = 0.194KNs 社科人文知识KNs 社科人文知识: Spearman ρ = 0.11, p = 0.198MS 心智建模MS 心智建模: Spearman ρ = 0.08, p = 0.341CEe 语言表达CEe 语言表达: Spearman ρ = 0.05, p = 0.527KNn 自然科学知识KNn 自然科学知识: Spearman ρ = 0.04, p = 0.658CS 输出契约严格度CS 输出契约严格度: Spearman ρ = 0.04, p = 0.661VB 自检负担VB 自检负担: Spearman ρ = -0.04, p = 0.652
图 4 27 个维度的需求等级与难度层(near-term=0, full-spectrum=1, last-exam=2)的 Spearman 相关,按大小排序;左侧色块为维度分组。悬停可见 ρ 与 p。
维度near-term (n=60)full-spectrum (n=46)last-exam (n=32)ρ vs tierp
PL 规划与长程执行agentic 补充2.783.023.62+0.43<0.001
MCr 相关信息识别ADeLe v1 原维度3.323.523.81+0.34<0.001
VO 工作量ADeLe v1 原维度3.533.634.12+0.32<0.001
BP 预算压力结果侧驱动补充1.551.502.62+0.32<0.001
MCu 已知未知校准ADeLe v1 原维度3.223.223.72+0.32<0.001
TU 工具与软件操作agentic 补充2.552.783.34+0.30<0.001
CL 概念化与抽象ADeLe v1 原维度2.372.433.03+0.29<0.001
MCt 批判性思维ADeLe v1 原维度3.383.433.84+0.28<0.001
SNs 空间物理推理ADeLe v1 原维度0.951.372.16+0.28<0.001
KNa 应用科学知识ADeLe v1 原维度2.983.373.84+0.260.002
AS 注意与扫描ADeLe v1 原维度3.053.173.44+0.260.002
AT 非典型性ADeLe v1 原维度3.033.223.34+0.240.005
EV 实证验证需求结果侧驱动补充1.471.522.22+0.230.006
SC 规格合规与自检agentic 补充3.323.593.66+0.230.006
PR 精度要求结果侧驱动补充2.953.223.53+0.230.007
QLl 逻辑推理ADeLe v1 原维度3.353.373.75+0.220.011
QLq 定量推理ADeLe v1 原维度2.822.873.47+0.190.022
VI 视觉感知与 GUIagentic 补充0.921.021.41+0.160.065
CEc 语言理解ADeLe v1 原维度3.123.203.38+0.160.068
KNf 形式科学知识ADeLe v1 原维度3.453.483.81+0.130.128
KNc 日常常识ADeLe v1 原维度1.471.611.59+0.110.194
KNs 社科人文知识ADeLe v1 原维度0.480.870.78+0.110.198
MS 心智建模ADeLe v1 原维度0.280.300.41+0.080.341
CEe 语言表达ADeLe v1 原维度1.331.431.44+0.050.527
KNn 自然科学知识ADeLe v1 原维度1.901.702.12+0.040.658
CS 输出契约严格度结果侧驱动补充3.653.763.69+0.040.661
VB 自检负担结果侧驱动补充3.603.543.56-0.040.652

2.5领域特征

需求画像按领域分开看才能回答“优化什么能力对哪些领域收益大”的第一半:每个领域在哪些维度上要求更高。图 5 是领域 × 维度的热力图,颜色越深平均等级越高,每行加黑边框的三格是该领域相对全体均值高出最多的维度;悬停可见数值和与全体均值的差。读法:横向看一行,是这个领域的需求指纹;纵向看一列,是这个维度在哪些领域被要求得最多。收益的另一半(改进哪项能力能翻转哪些领域的失败)在 4.5 节。

ADeLe v1 原维度(18)agentic 补充(4)结果侧驱动补充(5)
AS 注意与扫描CEc 语言理解CEe 语言表达CL 概念化与抽象MCr 相关信息识别MCt 批判性思维MCu 已知未知校准MS 心智建模QLl 逻辑推理QLq 定量推理SNs 空间物理推理KNa 应用科学知识KNc 日常常识KNf 形式科学知识KNn 自然科学知识KNs 社科人文知识AT 非典型性VO 工作量TU 工具与软件操作PL 规划与长程执行VI 视觉感知与 GUISC 规格合规与自检CS 输出契约严格度PR 精度要求VB 自检负担BP 预算压力EV 实证验证需求医疗健康 (26)医疗健康 · AS 注意与扫描: 平均 3.15 级(全体 3.19,差 -0.03)医疗健康 · CEc 语言理解: 平均 3.19 级(全体 3.20,差 -0.01)医疗健康 · CEe 语言表达: 平均 1.62 级(全体 1.39,差 +0.23)医疗健康 · CL 概念化与抽象: 平均 2.69 级(全体 2.55,差 +0.15)医疗健康 · MCr 相关信息识别: 平均 3.42 级(全体 3.50,差 -0.08)医疗健康 · MCt 批判性思维: 平均 3.58 级(全体 3.51,差 +0.07)医疗健康 · MCu 已知未知校准: 平均 3.50 级(全体 3.34,差 +0.16)医疗健康 · MS 心智建模: 平均 0.23 级(全体 0.32,差 -0.09)医疗健康 · QLl 逻辑推理: 平均 3.42 级(全体 3.45,差 -0.02)医疗健康 · QLq 定量推理: 平均 3.38 级(全体 2.99,差 +0.40)医疗健康 · SNs 空间物理推理: 平均 1.00 级(全体 1.40,差 -0.40)医疗健康 · KNa 应用科学知识: 平均 4.15 级(全体 3.32,差 +0.84)医疗健康 · KNc 日常常识: 平均 1.35 级(全体 1.55,差 -0.20)医疗健康 · KNf 形式科学知识: 平均 3.81 级(全体 3.54,差 +0.27)医疗健康 · KNn 自然科学知识: 平均 2.65 级(全体 1.88,差 +0.78)医疗健康 · KNs 社科人文知识: 平均 0.38 级(全体 0.68,差 -0.29)医疗健康 · AT 非典型性: 平均 3.19 级(全体 3.17,差 +0.02)医疗健康 · VO 工作量: 平均 3.85 级(全体 3.71,差 +0.14)医疗健康 · TU 工具与软件操作: 平均 2.69 级(全体 2.81,差 -0.12)医疗健康 · PL 规划与长程执行: 平均 3.08 级(全体 3.06,差 +0.01)医疗健康 · VI 视觉感知与 GUI: 平均 0.77 级(全体 1.09,差 -0.32)医疗健康 · SC 规格合规与自检: 平均 3.35 级(全体 3.48,差 -0.14)医疗健康 · CS 输出契约严格度: 平均 3.54 级(全体 3.70,差 -0.16)医疗健康 · PR 精度要求: 平均 3.38 级(全体 3.17,差 +0.21)医疗健康 · VB 自检负担: 平均 3.77 级(全体 3.58,差 +0.19)医疗健康 · BP 预算压力: 平均 1.77 级(全体 1.78,差 -0.01)医疗健康 · EV 实证验证需求: 平均 2.00 级(全体 1.66,差 +0.34)计算与数学 (23)计算与数学 · AS 注意与扫描: 平均 2.96 级(全体 3.19,差 -0.23)计算与数学 · CEc 语言理解: 平均 3.26 级(全体 3.20,差 +0.06)计算与数学 · CEe 语言表达: 平均 1.30 级(全体 1.39,差 -0.08)计算与数学 · CL 概念化与抽象: 平均 2.87 级(全体 2.55,差 +0.32)计算与数学 · MCr 相关信息识别: 平均 3.61 级(全体 3.50,差 +0.11)计算与数学 · MCt 批判性思维: 平均 3.74 级(全体 3.51,差 +0.23)计算与数学 · MCu 已知未知校准: 平均 3.39 级(全体 3.34,差 +0.05)计算与数学 · MS 心智建模: 平均 0.39 级(全体 0.32,差 +0.07)计算与数学 · QLl 逻辑推理: 平均 3.83 级(全体 3.45,差 +0.38)计算与数学 · QLq 定量推理: 平均 3.00 级(全体 2.99,差 +0.01)计算与数学 · SNs 空间物理推理: 平均 0.65 级(全体 1.40,差 -0.74)计算与数学 · KNa 应用科学知识: 平均 1.13 级(全体 3.32,差 -2.19)计算与数学 · KNc 日常常识: 平均 1.26 级(全体 1.55,差 -0.29)计算与数学 · KNf 形式科学知识: 平均 4.04 级(全体 3.54,差 +0.50)计算与数学 · KNn 自然科学知识: 平均 0.48 级(全体 1.88,差 -1.40)计算与数学 · KNs 社科人文知识: 平均 0.13 级(全体 0.68,差 -0.55)计算与数学 · AT 非典型性: 平均 3.30 级(全体 3.17,差 +0.13)计算与数学 · VO 工作量: 平均 3.65 级(全体 3.71,差 -0.05)计算与数学 · TU 工具与软件操作: 平均 2.65 级(全体 2.81,差 -0.16)计算与数学 · PL 规划与长程执行: 平均 3.04 级(全体 3.06,差 -0.02)计算与数学 · VI 视觉感知与 GUI: 平均 0.57 级(全体 1.09,差 -0.52)计算与数学 · SC 规格合规与自检: 平均 3.61 级(全体 3.48,差 +0.13)计算与数学 · CS 输出契约严格度: 平均 3.70 级(全体 3.70,差 -0.00)计算与数学 · PR 精度要求: 平均 3.13 级(全体 3.17,差 -0.04)计算与数学 · VB 自检负担: 平均 3.39 级(全体 3.58,差 -0.18)计算与数学 · BP 预算压力: 平均 1.61 级(全体 1.78,差 -0.18)计算与数学 · EV 实证验证需求: 平均 1.61 级(全体 1.66,差 -0.05)商业金融 (21)商业金融 · AS 注意与扫描: 平均 3.43 级(全体 3.19,差 +0.24)商业金融 · CEc 语言理解: 平均 3.33 级(全体 3.20,差 +0.13)商业金融 · CEe 语言表达: 平均 1.57 级(全体 1.39,差 +0.18)商业金融 · CL 概念化与抽象: 平均 2.29 级(全体 2.55,差 -0.26)商业金融 · MCr 相关信息识别: 平均 3.52 级(全体 3.50,差 +0.02)商业金融 · MCt 批判性思维: 平均 3.43 级(全体 3.51,差 -0.08)商业金融 · MCu 已知未知校准: 平均 3.24 级(全体 3.34,差 -0.10)商业金融 · MS 心智建模: 平均 0.71 级(全体 0.32,差 +0.40)商业金融 · QLl 逻辑推理: 平均 3.38 级(全体 3.45,差 -0.07)商业金融 · QLq 定量推理: 平均 2.48 级(全体 2.99,差 -0.51)商业金融 · SNs 空间物理推理: 平均 0.62 级(全体 1.40,差 -0.78)商业金融 · KNa 应用科学知识: 平均 3.57 级(全体 3.32,差 +0.25)商业金融 · KNc 日常常识: 平均 2.62 级(全体 1.55,差 +1.07)商业金融 · KNf 形式科学知识: 平均 3.05 级(全体 3.54,差 -0.49)商业金融 · KNn 自然科学知识: 平均 0.00 级(全体 1.88,差 -1.88)商业金融 · KNs 社科人文知识: 平均 2.52 级(全体 0.68,差 +1.85)商业金融 · AT 非典型性: 平均 3.05 级(全体 3.17,差 -0.13)商业金融 · VO 工作量: 平均 3.71 级(全体 3.71,差 +0.01)商业金融 · TU 工具与软件操作: 平均 2.33 级(全体 2.81,差 -0.48)商业金融 · PL 规划与长程执行: 平均 2.95 级(全体 3.06,差 -0.11)商业金融 · VI 视觉感知与 GUI: 平均 1.10 级(全体 1.09,差 +0.01)商业金融 · SC 规格合规与自检: 平均 3.48 级(全体 3.48,差 -0.01)商业金融 · CS 输出契约严格度: 平均 4.05 级(全体 3.70,差 +0.35)商业金融 · PR 精度要求: 平均 3.19 级(全体 3.17,差 +0.02)商业金融 · VB 自检负担: 平均 3.67 级(全体 3.58,差 +0.09)商业金融 · BP 预算压力: 平均 1.86 级(全体 1.78,差 +0.07)商业金融 · EV 实证验证需求: 平均 1.14 级(全体 1.66,差 -0.52)工程 (20)工程 · AS 注意与扫描: 平均 3.40 级(全体 3.19,差 +0.21)工程 · CEc 语言理解: 平均 3.25 级(全体 3.20,差 +0.05)工程 · CEe 语言表达: 平均 1.25 级(全体 1.39,差 -0.14)工程 · CL 概念化与抽象: 平均 2.75 级(全体 2.55,差 +0.20)工程 · MCr 相关信息识别: 平均 3.70 级(全体 3.50,差 +0.20)工程 · MCt 批判性思维: 平均 3.55 级(全体 3.51,差 +0.04)工程 · MCu 已知未知校准: 平均 3.55 级(全体 3.34,差 +0.21)工程 · MS 心智建模: 平均 0.10 级(全体 0.32,差 -0.22)工程 · QLl 逻辑推理: 平均 3.45 级(全体 3.45,差 +0.00)工程 · QLq 定量推理: 平均 3.15 级(全体 2.99,差 +0.16)工程 · SNs 空间物理推理: 平均 3.15 级(全体 1.40,差 +1.75)工程 · KNa 应用科学知识: 平均 4.05 级(全体 3.32,差 +0.73)工程 · KNc 日常常识: 平均 1.55 级(全体 1.55,差 +0.00)工程 · KNf 形式科学知识: 平均 3.50 级(全体 3.54,差 -0.04)工程 · KNn 自然科学知识: 平均 2.05 级(全体 1.88,差 +0.17)工程 · KNs 社科人文知识: 平均 0.10 级(全体 0.68,差 -0.58)工程 · AT 非典型性: 平均 3.50 级(全体 3.17,差 +0.33)工程 · VO 工作量: 平均 3.75 级(全体 3.71,差 +0.04)工程 · TU 工具与软件操作: 平均 3.55 级(全体 2.81,差 +0.74)工程 · PL 规划与长程执行: 平均 3.50 级(全体 3.06,差 +0.44)工程 · VI 视觉感知与 GUI: 平均 2.25 级(全体 1.09,差 +1.16)工程 · SC 规格合规与自检: 平均 3.85 级(全体 3.48,差 +0.37)工程 · CS 输出契约严格度: 平均 3.65 级(全体 3.70,差 -0.05)工程 · PR 精度要求: 平均 3.30 级(全体 3.17,差 +0.13)工程 · VB 自检负担: 平均 3.35 级(全体 3.58,差 -0.23)工程 · BP 预算压力: 平均 2.15 级(全体 1.78,差 +0.37)工程 · EV 实证验证需求: 平均 2.20 级(全体 1.66,差 +0.54)生命科学 (19)生命科学 · AS 注意与扫描: 平均 3.05 级(全体 3.19,差 -0.13)生命科学 · CEc 语言理解: 平均 2.89 级(全体 3.20,差 -0.31)生命科学 · CEe 语言表达: 平均 1.21 级(全体 1.39,差 -0.18)生命科学 · CL 概念化与抽象: 平均 1.95 级(全体 2.55,差 -0.60)生命科学 · MCr 相关信息识别: 平均 3.21 级(全体 3.50,差 -0.29)生命科学 · MCt 批判性思维: 平均 3.21 级(全体 3.51,差 -0.30)生命科学 · MCu 已知未知校准: 平均 3.05 级(全体 3.34,差 -0.29)生命科学 · MS 心智建模: 平均 0.00 级(全体 0.32,差 -0.32)生命科学 · QLl 逻辑推理: 平均 3.16 级(全体 3.45,差 -0.29)生命科学 · QLq 定量推理: 平均 2.63 级(全体 2.99,差 -0.35)生命科学 · SNs 空间物理推理: 平均 0.89 级(全体 1.40,差 -0.50)生命科学 · KNa 应用科学知识: 平均 3.95 级(全体 3.32,差 +0.63)生命科学 · KNc 日常常识: 平均 1.05 级(全体 1.55,差 -0.49)生命科学 · KNf 形式科学知识: 平均 3.58 级(全体 3.54,差 +0.04)生命科学 · KNn 自然科学知识: 平均 3.47 级(全体 1.88,差 +1.60)生命科学 · KNs 社科人文知识: 平均 0.00 级(全体 0.68,差 -0.68)生命科学 · AT 非典型性: 平均 2.79 级(全体 3.17,差 -0.38)生命科学 · VO 工作量: 平均 3.42 级(全体 3.71,差 -0.28)生命科学 · TU 工具与软件操作: 平均 3.11 级(全体 2.81,差 +0.29)生命科学 · PL 规划与长程执行: 平均 2.74 级(全体 3.06,差 -0.33)生命科学 · VI 视觉感知与 GUI: 平均 0.68 级(全体 1.09,差 -0.40)生命科学 · SC 规格合规与自检: 平均 3.26 级(全体 3.48,差 -0.22)生命科学 · CS 输出契约严格度: 平均 3.74 级(全体 3.70,差 +0.04)生命科学 · PR 精度要求: 平均 2.84 级(全体 3.17,差 -0.33)生命科学 · VB 自检负担: 平均 3.58 级(全体 3.58,差 +0.00)生命科学 · BP 预算压力: 平均 1.68 级(全体 1.78,差 -0.10)生命科学 · EV 实证验证需求: 平均 1.63 级(全体 1.66,差 -0.03)物理科学 (15)物理科学 · AS 注意与扫描: 平均 3.00 级(全体 3.19,差 -0.19)物理科学 · CEc 语言理解: 平均 3.00 级(全体 3.20,差 -0.20)物理科学 · CEe 语言表达: 平均 1.07 级(全体 1.39,差 -0.32)物理科学 · CL 概念化与抽象: 平均 2.53 级(全体 2.55,差 -0.01)物理科学 · MCr 相关信息识别: 平均 3.40 级(全体 3.50,差 -0.10)物理科学 · MCt 批判性思维: 平均 3.60 级(全体 3.51,差 +0.09)物理科学 · MCu 已知未知校准: 平均 3.27 级(全体 3.34,差 -0.07)物理科学 · MS 心智建模: 平均 0.00 级(全体 0.32,差 -0.32)物理科学 · QLl 逻辑推理: 平均 3.40 级(全体 3.45,差 -0.05)物理科学 · QLq 定量推理: 平均 3.53 级(全体 2.99,差 +0.55)物理科学 · SNs 空间物理推理: 平均 2.47 级(全体 1.40,差 +1.07)物理科学 · KNa 应用科学知识: 平均 3.27 级(全体 3.32,差 -0.05)物理科学 · KNc 日常常识: 平均 1.07 级(全体 1.55,差 -0.48)物理科学 · KNf 形式科学知识: 平均 3.47 级(全体 3.54,差 -0.07)物理科学 · KNn 自然科学知识: 平均 4.27 级(全体 1.88,差 +2.39)物理科学 · KNs 社科人文知识: 平均 0.00 级(全体 0.68,差 -0.68)物理科学 · AT 非典型性: 平均 2.93 级(全体 3.17,差 -0.24)物理科学 · VO 工作量: 平均 3.93 级(全体 3.71,差 +0.23)物理科学 · TU 工具与软件操作: 平均 3.00 级(全体 2.81,差 +0.19)物理科学 · PL 规划与长程执行: 平均 3.20 级(全体 3.06,差 +0.14)物理科学 · VI 视觉感知与 GUI: 平均 1.00 级(全体 1.09,差 -0.09)物理科学 · SC 规格合规与自检: 平均 3.47 级(全体 3.48,差 -0.02)物理科学 · CS 输出契约严格度: 平均 3.53 级(全体 3.70,差 -0.16)物理科学 · PR 精度要求: 平均 3.20 级(全体 3.17,差 +0.03)物理科学 · VB 自检负担: 平均 3.60 级(全体 3.58,差 +0.02)物理科学 · BP 预算压力: 平均 1.93 级(全体 1.78,差 +0.15)物理科学 · EV 实证验证需求: 平均 1.67 级(全体 1.66,差 +0.00)教育信息 (4)教育信息 · AS 注意与扫描: 平均 3.00 级(全体 3.19,差 -0.19)教育信息 · CEc 语言理解: 平均 3.50 级(全体 3.20,差 +0.30)教育信息 · CEe 语言表达: 平均 2.50 级(全体 1.39,差 +1.11)教育信息 · CL 概念化与抽象: 平均 2.50 级(全体 2.55,差 -0.05)教育信息 · MCr 相关信息识别: 平均 3.75 级(全体 3.50,差 +0.25)教育信息 · MCt 批判性思维: 平均 3.50 级(全体 3.51,差 -0.01)教育信息 · MCu 已知未知校准: 平均 3.25 级(全体 3.34,差 -0.09)教育信息 · MS 心智建模: 平均 1.00 级(全体 0.32,差 +0.68)教育信息 · QLl 逻辑推理: 平均 3.50 级(全体 3.45,差 +0.05)教育信息 · QLq 定量推理: 平均 2.50 级(全体 2.99,差 -0.49)教育信息 · SNs 空间物理推理: 平均 0.75 级(全体 1.40,差 -0.65)教育信息 · KNa 应用科学知识: 平均 2.75 级(全体 3.32,差 -0.57)教育信息 · KNc 日常常识: 平均 2.00 级(全体 1.55,差 +0.45)教育信息 · KNf 形式科学知识: 平均 3.00 级(全体 3.54,差 -0.54)教育信息 · KNn 自然科学知识: 平均 0.25 级(全体 1.88,差 -1.63)教育信息 · KNs 社科人文知识: 平均 2.50 级(全体 0.68,差 +1.82)教育信息 · AT 非典型性: 平均 3.75 级(全体 3.17,差 +0.58)教育信息 · VO 工作量: 平均 3.50 级(全体 3.71,差 -0.21)教育信息 · TU 工具与软件操作: 平均 2.25 级(全体 2.81,差 -0.56)教育信息 · PL 规划与长程执行: 平均 2.50 级(全体 3.06,差 -0.56)教育信息 · VI 视觉感知与 GUI: 平均 0.75 级(全体 1.09,差 -0.34)教育信息 · SC 规格合规与自检: 平均 3.50 级(全体 3.48,差 +0.02)教育信息 · CS 输出契约严格度: 平均 4.00 级(全体 3.70,差 +0.30)教育信息 · PR 精度要求: 平均 3.00 级(全体 3.17,差 -0.17)教育信息 · VB 自检负担: 平均 3.75 级(全体 3.58,差 +0.17)教育信息 · BP 预算压力: 平均 1.00 级(全体 1.78,差 -0.78)教育信息 · EV 实证验证需求: 平均 1.00 级(全体 1.66,差 -0.66)心理神经 (3)心理神经 · AS 注意与扫描: 平均 4.00 级(全体 3.19,差 +0.81)心理神经 · CEc 语言理解: 平均 3.33 级(全体 3.20,差 +0.13)心理神经 · CEe 语言表达: 平均 1.00 级(全体 1.39,差 -0.39)心理神经 · CL 概念化与抽象: 平均 2.67 级(全体 2.55,差 +0.12)心理神经 · MCr 相关信息识别: 平均 3.67 级(全体 3.50,差 +0.16)心理神经 · MCt 批判性思维: 平均 3.33 级(全体 3.51,差 -0.18)心理神经 · MCu 已知未知校准: 平均 3.33 级(全体 3.34,差 -0.00)心理神经 · MS 心智建模: 平均 1.00 级(全体 0.32,差 +0.68)心理神经 · QLl 逻辑推理: 平均 3.00 级(全体 3.45,差 -0.45)心理神经 · QLq 定量推理: 平均 2.33 级(全体 2.99,差 -0.65)心理神经 · SNs 空间物理推理: 平均 2.33 级(全体 1.40,差 +0.94)心理神经 · KNa 应用科学知识: 平均 3.00 级(全体 3.32,差 -0.32)心理神经 · KNc 日常常识: 平均 2.00 级(全体 1.55,差 +0.45)心理神经 · KNf 形式科学知识: 平均 3.00 级(全体 3.54,差 -0.54)心理神经 · KNn 自然科学知识: 平均 1.00 级(全体 1.88,差 -0.88)心理神经 · KNs 社科人文知识: 平均 1.33 级(全体 0.68,差 +0.66)心理神经 · AT 非典型性: 平均 3.33 级(全体 3.17,差 +0.16)心理神经 · VO 工作量: 平均 4.00 级(全体 3.71,差 +0.29)心理神经 · TU 工具与软件操作: 平均 2.67 级(全体 2.81,差 -0.15)心理神经 · PL 规划与长程执行: 平均 3.00 级(全体 3.06,差 -0.06)心理神经 · VI 视觉感知与 GUI: 平均 3.00 级(全体 1.09,差 +1.91)心理神经 · SC 规格合规与自检: 平均 3.33 级(全体 3.48,差 -0.15)心理神经 · CS 输出契约严格度: 平均 4.00 级(全体 3.70,差 +0.30)心理神经 · PR 精度要求: 平均 3.33 级(全体 3.17,差 +0.16)心理神经 · VB 自检负担: 平均 3.67 级(全体 3.58,差 +0.09)心理神经 · BP 预算压力: 平均 1.67 级(全体 1.78,差 -0.12)心理神经 · EV 实证验证需求: 平均 2.00 级(全体 1.66,差 +0.34)交通安全 (3)交通安全 · AS 注意与扫描: 平均 2.67 级(全体 3.19,差 -0.52)交通安全 · CEc 语言理解: 平均 3.33 级(全体 3.20,差 +0.13)交通安全 · CEe 语言表达: 平均 1.33 级(全体 1.39,差 -0.06)交通安全 · CL 概念化与抽象: 平均 2.67 级(全体 2.55,差 +0.12)交通安全 · MCr 相关信息识别: 平均 3.33 级(全体 3.50,差 -0.17)交通安全 · MCt 批判性思维: 平均 3.33 级(全体 3.51,差 -0.18)交通安全 · MCu 已知未知校准: 平均 3.00 级(全体 3.34,差 -0.34)交通安全 · MS 心智建模: 平均 0.33 级(全体 0.32,差 +0.02)交通安全 · QLl 逻辑推理: 平均 3.67 级(全体 3.45,差 +0.22)交通安全 · QLq 定量推理: 平均 3.67 级(全体 2.99,差 +0.68)交通安全 · SNs 空间物理推理: 平均 2.00 级(全体 1.40,差 +0.60)交通安全 · KNa 应用科学知识: 平均 4.00 级(全体 3.32,差 +0.68)交通安全 · KNc 日常常识: 平均 1.33 级(全体 1.55,差 -0.21)交通安全 · KNf 形式科学知识: 平均 4.00 级(全体 3.54,差 +0.46)交通安全 · KNn 自然科学知识: 平均 1.67 级(全体 1.88,差 -0.21)交通安全 · KNs 社科人文知识: 平均 0.33 级(全体 0.68,差 -0.34)交通安全 · AT 非典型性: 平均 3.00 级(全体 3.17,差 -0.17)交通安全 · VO 工作量: 平均 3.67 级(全体 3.71,差 -0.04)交通安全 · TU 工具与软件操作: 平均 2.33 级(全体 2.81,差 -0.48)交通安全 · PL 规划与长程执行: 平均 3.33 级(全体 3.06,差 +0.27)交通安全 · VI 视觉感知与 GUI: 平均 0.00 级(全体 1.09,差 -1.09)交通安全 · SC 规格合规与自检: 平均 3.67 级(全体 3.48,差 +0.18)交通安全 · CS 输出契约严格度: 平均 3.67 级(全体 3.70,差 -0.03)交通安全 · PR 精度要求: 平均 2.67 级(全体 3.17,差 -0.51)交通安全 · VB 自检负担: 平均 3.67 级(全体 3.58,差 +0.09)交通安全 · BP 预算压力: 平均 1.67 级(全体 1.78,差 -0.12)交通安全 · EV 实证验证需求: 平均 1.33 级(全体 1.66,差 -0.33)法律 (2)法律 · AS 注意与扫描: 平均 3.50 级(全体 3.19,差 +0.31)法律 · CEc 语言理解: 平均 4.00 级(全体 3.20,差 +0.80)法律 · CEe 语言表达: 平均 2.00 级(全体 1.39,差 +0.61)法律 · CL 概念化与抽象: 平均 2.50 级(全体 2.55,差 -0.05)法律 · MCr 相关信息识别: 平均 4.00 级(全体 3.50,差 +0.50)法律 · MCt 批判性思维: 平均 3.00 级(全体 3.51,差 -0.51)法律 · MCu 已知未知校准: 平均 3.00 级(全体 3.34,差 -0.34)法律 · MS 心智建模: 平均 0.50 级(全体 0.32,差 +0.18)法律 · QLl 逻辑推理: 平均 3.00 级(全体 3.45,差 -0.45)法律 · QLq 定量推理: 平均 2.00 级(全体 2.99,差 -0.99)法律 · SNs 空间物理推理: 平均 0.00 级(全体 1.40,差 -1.40)法律 · KNa 应用科学知识: 平均 4.00 级(全体 3.32,差 +0.68)法律 · KNc 日常常识: 平均 2.50 级(全体 1.55,差 +0.95)法律 · KNf 形式科学知识: 平均 2.50 级(全体 3.54,差 -1.04)法律 · KNn 自然科学知识: 平均 0.00 级(全体 1.88,差 -1.88)法律 · KNs 社科人文知识: 平均 3.00 级(全体 0.68,差 +2.32)法律 · AT 非典型性: 平均 3.00 级(全体 3.17,差 -0.17)法律 · VO 工作量: 平均 3.50 级(全体 3.71,差 -0.21)法律 · TU 工具与软件操作: 平均 2.00 级(全体 2.81,差 -0.81)法律 · PL 规划与长程执行: 平均 2.50 级(全体 3.06,差 -0.56)法律 · VI 视觉感知与 GUI: 平均 0.50 级(全体 1.09,差 -0.59)法律 · SC 规格合规与自检: 平均 3.00 级(全体 3.48,差 -0.48)法律 · CS 输出契约严格度: 平均 3.00 级(全体 3.70,差 -0.70)法律 · PR 精度要求: 平均 3.00 级(全体 3.17,差 -0.17)法律 · VB 自检负担: 平均 4.00 级(全体 3.58,差 +0.42)法律 · BP 预算压力: 平均 1.00 级(全体 1.78,差 -0.78)法律 · EV 实证验证需求: 平均 0.00 级(全体 1.66,差 -1.66)其他 (2)其他 · AS 注意与扫描: 平均 3.50 级(全体 3.19,差 +0.31)其他 · CEc 语言理解: 平均 3.00 级(全体 3.20,差 -0.20)其他 · CEe 语言表达: 平均 0.50 级(全体 1.39,差 -0.89)其他 · CL 概念化与抽象: 平均 3.00 级(全体 2.55,差 +0.45)其他 · MCr 相关信息识别: 平均 3.50 级(全体 3.50,差 -0.00)其他 · MCt 批判性思维: 平均 3.50 级(全体 3.51,差 -0.01)其他 · MCu 已知未知校准: 平均 3.50 级(全体 3.34,差 +0.16)其他 · MS 心智建模: 平均 1.00 级(全体 0.32,差 +0.68)其他 · QLl 逻辑推理: 平均 3.50 级(全体 3.45,差 +0.05)其他 · QLq 定量推理: 平均 2.00 级(全体 2.99,差 -0.99)其他 · SNs 空间物理推理: 平均 3.50 级(全体 1.40,差 +2.10)其他 · KNa 应用科学知识: 平均 2.00 级(全体 3.32,差 -1.32)其他 · KNc 日常常识: 平均 2.50 级(全体 1.55,差 +0.95)其他 · KNf 形式科学知识: 平均 2.00 级(全体 3.54,差 -1.54)其他 · KNn 自然科学知识: 平均 0.00 级(全体 1.88,差 -1.88)其他 · KNs 社科人文知识: 平均 0.50 级(全体 0.68,差 -0.18)其他 · AT 非典型性: 平均 4.00 级(全体 3.17,差 +0.83)其他 · VO 工作量: 平均 3.00 级(全体 3.71,差 -0.71)其他 · TU 工具与软件操作: 平均 2.00 级(全体 2.81,差 -0.81)其他 · PL 规划与长程执行: 平均 3.00 级(全体 3.06,差 -0.06)其他 · VI 视觉感知与 GUI: 平均 4.00 级(全体 1.09,差 +2.91)其他 · SC 规格合规与自检: 平均 3.00 级(全体 3.48,差 -0.48)其他 · CS 输出契约严格度: 平均 3.00 级(全体 3.70,差 -0.70)其他 · PR 精度要求: 平均 3.00 级(全体 3.17,差 -0.17)其他 · VB 自检负担: 平均 3.50 级(全体 3.58,差 -0.08)其他 · BP 预算压力: 平均 2.00 级(全体 1.78,差 +0.22)其他 · EV 实证验证需求: 平均 1.00 级(全体 1.66,差 -0.66)社会科学 (1)社会科学 · AS 注意与扫描: 平均 4.00 级(全体 3.19,差 +0.81)社会科学 · CEc 语言理解: 平均 4.00 级(全体 3.20,差 +0.80)社会科学 · CEe 语言表达: 平均 2.00 级(全体 1.39,差 +0.61)社会科学 · CL 概念化与抽象: 平均 3.00 级(全体 2.55,差 +0.45)社会科学 · MCr 相关信息识别: 平均 4.00 级(全体 3.50,差 +0.50)社会科学 · MCt 批判性思维: 平均 4.00 级(全体 3.51,差 +0.49)社会科学 · MCu 已知未知校准: 平均 4.00 级(全体 3.34,差 +0.66)社会科学 · MS 心智建模: 平均 1.00 级(全体 0.32,差 +0.68)社会科学 · QLl 逻辑推理: 平均 4.00 级(全体 3.45,差 +0.55)社会科学 · QLq 定量推理: 平均 4.00 级(全体 2.99,差 +1.01)社会科学 · SNs 空间物理推理: 平均 0.00 级(全体 1.40,差 -1.40)社会科学 · KNa 应用科学知识: 平均 3.00 级(全体 3.32,差 -0.32)社会科学 · KNc 日常常识: 平均 1.00 级(全体 1.55,差 -0.55)社会科学 · KNf 形式科学知识: 平均 4.00 级(全体 3.54,差 +0.46)社会科学 · KNn 自然科学知识: 平均 1.00 级(全体 1.88,差 -0.88)社会科学 · KNs 社科人文知识: 平均 4.00 级(全体 0.68,差 +3.32)社会科学 · AT 非典型性: 平均 3.00 级(全体 3.17,差 -0.17)社会科学 · VO 工作量: 平均 4.00 级(全体 3.71,差 +0.29)社会科学 · TU 工具与软件操作: 平均 4.00 级(全体 2.81,差 +1.19)社会科学 · PL 规划与长程执行: 平均 4.00 级(全体 3.06,差 +0.94)社会科学 · VI 视觉感知与 GUI: 平均 1.00 级(全体 1.09,差 -0.09)社会科学 · SC 规格合规与自检: 平均 3.00 级(全体 3.48,差 -0.48)社会科学 · CS 输出契约严格度: 平均 4.00 级(全体 3.70,差 +0.30)社会科学 · PR 精度要求: 平均 4.00 级(全体 3.17,差 +0.83)社会科学 · VB 自检负担: 平均 3.00 级(全体 3.58,差 -0.58)社会科学 · BP 预算压力: 平均 2.00 级(全体 1.78,差 +0.22)社会科学 · EV 实证验证需求: 平均 2.00 级(全体 1.66,差 +0.34)
图 5 各领域在 27 个维度上的平均需求等级(0 到 5,颜色深浅),黑框为该领域相对全体均值最突出的三个维度。领域后括号为任务数,样本少于 5 的领域只作参考。

知识类维度的领域指纹最清楚:应用科学知识 KNa 在医疗、工程、生命科学接近 4 级,在计算与数学只有 1 级;自然科学知识 KNn 集中在物理科学(4.3)和生命科学(3.5),商业金融和法律为 0;形式科学知识 KNf 在计算与数学最高(4.0);空间推理 SNs 和视觉 VI 集中在工程;社科知识 KNs 只在商业金融、法律、教育出现。过程性维度的领域差异小得多:工具操作 TU、规划 PL、预算压力 BP 在工程最高,实证验证需求 EV 在物理科学和医疗最高。各领域最突出的三个维度:医疗健康 KNa, KNn, QLq;计算与数学 KNf, QLl, CL;商业金融 KNs, KNc, MS;工程 SNs, VI, TU;生命科学 KNn, KNa, TU;物理科学 KNn, SNs, QLq。

展开:领域 × 维度均值表
领域 (n)KNaKNfKNnKNsQLqSNsTUVIPLVO
医疗健康 (26)4.23.82.60.43.41.02.70.83.13.9
计算与数学 (23)1.14.00.50.13.00.72.60.63.03.6
商业金融 (21)3.63.00.02.52.50.62.31.13.03.7
工程 (20)4.03.52.00.13.13.13.52.23.53.8
生命科学 (19)4.03.63.50.02.60.93.10.72.73.4
物理科学 (15)3.33.54.30.03.52.53.01.03.23.9
教育信息 (4)2.83.00.22.52.50.82.20.82.53.5
心理神经 (3)3.03.01.01.32.32.32.73.03.04.0
交通安全 (3)4.04.01.70.33.72.02.30.03.33.7
法律 (2)4.02.50.03.02.00.02.00.52.53.5
其他 (2)2.02.00.00.52.03.52.04.03.03.0
社会科学 (1)3.04.01.04.04.00.04.01.04.04.0

2.6标注质量与局限

两个问题会直接影响第 3 节的解读。第一,方差压缩:AS、AT、CEc、MCr、MCt、MCu、SC 等维度九成以上任务挤在 3 到 4 级,5 级极少。这可能是 rubric 顶层示例对 agentic 任务分辨率不够,也可能是判分模型偏保守;无论哪种,它意味着这些维度在任务之间几乎没有区分度,后面"与通过率无关"的结论要先排除这个原因。第二,单次判分、无重复:每对只采样一次,判分噪声未估计。对同一批 prompt 重复采样取中位数不需要新输入,但只能压掉噪声,压不掉系统性天花板。

2.7结果侧驱动维度的分布与冗余度

结果侧驱动的五个维度需要单独回答一个问题:它们是不是原 22 维已经有的信息。下表给出每个维度的等级分布、与难度分层的相关、与原 22 维综合因子的相关,以及相关最高的原维度(139 个任务齐全)。

维度L1L2L3L4L5均值标准差ρ vs tierρ vs 原 22 维综合因子与原维度的最高相关
CS 输出契约严格度09319273.700.67+0.04+0.24CEc +0.40, SC +0.35, KNs +0.28
PR 精度要求5236535113.170.92+0.23 *+0.39CL +0.40, MCr +0.35, VO +0.35
VB 自检负担117298573.580.80-0.04+0.12MCu +0.22, KNa +0.16, MCr +0.15
BP 预算压力674518811.780.93+0.32 *+0.58PL +0.68, VO +0.61, TU +0.54
EV 实证验证需求5834201011.661.13+0.23 *+0.53QLq +0.62, CL +0.59, PL +0.59

三点观察。PR 和 BP 的等级分布展开了(标准差 0.93),没有原维度那种 3 到 4 级的挤压;CS 仍然挤在 4 级,说明契约严格是 ALE 的普遍属性而不是区分因素。VB 与原 22 维几乎独立(与任一维度的相关不超过 0.22,与综合因子 +0.12),是原体系里没有的信息;BP 则与 PL、VO、TU 高度相关(PL +0.68, VO +0.61, TU +0.54),是同一个"长程、大量"因子的运行面。PR 与 CL、QLl、VO 相关约 0.4,部分重叠。第五个维度 EV 的分布最宽(标准差 1.13,从 0 到 4 级都有支撑),与 QLq、CL、PL 相关约 0.6,是“定量、抽象、长程”那一簇的实证面。

3当前模型在 ALE 上的能力 #

3.1为什么需要两个视角

需求侧是 ADeLe 的标准路径:把每个任务的需求画像和 agent 的通过与否放在一起,问"什么样的任务会失败"。它的长处是可量化、可比较、不依赖任何人对失败过程的解读;短处是相关性分析,维度之间共线时无法归因到单一维度,等级方差被压缩的维度会显得"无关",而标签的选择偏差会同时污染所有维度。

结果侧读每个失败运行的轨迹叙述(agent 的最终报告、分章节小结、评分规则、得分),问"这次为什么失败"。它能看到需求侧看不到的结构:一个 0 分是因为算错了、没做完,还是做完了但文件名写错。短处是它依赖判分模型对 agent 自述的推断,不是评分器的诊断输出,置信度有限,也不能给出"这个 agent 能扛几级"这样的量化边界。

两个视角的盲区互补:需求侧告诉我们失败沿哪个方向单调上升,结果侧告诉我们失败的具体形态;一个结论只有在两边都站得住时才算可靠。

3.2需求侧

通过率随整体需求单调下降。取核心六维(PL、AS、CL、MCu、MCr、VO)的最高等级作任务的"台阶":opus-4.8 在 3 级任务上通过 55%,4 级 28%,5 级 17%;gpt-5.5 是 88%、38%、0%。综合需求因子与通过率的 Spearman 为 -0.34(opus-4.8)和 -0.44(gpt-5.5),都显著。

claude-code / opus-4.8codex / gpt-5.5
0%25%50%75%100%claude-code / opus-4.8 · 核心六维最高 3 级: 通过 55% (n=29)55%codex / gpt-5.5 · 核心六维最高 3 级: 通过 88% (n=8)88%核心六维最高 = 3 级claude-code / opus-4.8 · 核心六维最高 4 级: 通过 28% (n=46)28%codex / gpt-5.5 · 核心六维最高 4 级: 通过 38% (n=24)38%核心六维最高 = 4 级claude-code / opus-4.8 · 核心六维最高 5 级: 通过 17% (n=6)17%codex / gpt-5.5 · 核心六维最高 5 级: 通过 0% (n=5)0%核心六维最高 = 5 级
图 6 按核心六维最高等级分层的通过率。从 3 级到 4 级是最陡的一个台阶。悬停可见每组任务数(gpt-5.5 的 5 级组只有 5 个任务)。

能力画像。ADeLe 的 ability 是对每个维度拟合"通过概率 ~ 需求等级"的逻辑曲线后在 0 到 5 级上的平均高度;level_50 是曲线跌到 50% 的等级,是最直观的单个数字。针对 N ≈ 100 的情况,本文关闭了工具包默认的"该维度必须是最大需求"过滤(否则每维只剩几个点),只对有 5 个以上样本的等级做重平衡,并对任务做 300 次 bootstrap 给出置信区间;每维附不依赖模型的 Spearman 相关作为交叉检验。软标签版本用 ALE 原始分数替代 0/1,模型在 0/1 标签下与二值版本完全一致。

claude-code / opus-4.8(n = 81):

维度ability 二值 [95% CI]level_50 二值ρ 二值ability 软标签level_50 软标签ρ 软标签
PL 规划与长程执行0.47 [0.37, 0.56]2.3-0.32 *0.683.7-0.37 *
AS 注意与扫描0.54 [0.40, 0.62]2.7-0.31 *0.663.4-0.38 *
CL 概念化与抽象0.41 [0.30, 0.51]1.9-0.27 *0.583.0-0.36 *
MCu 已知未知校准0.55 [0.46, 0.64]2.8-0.32 *0.703.6-0.36 *
MCr 相关信息识别0.57 [0.42, 0.64]2.9-0.29 *0.734.0-0.30 *
VO 工作量0.56 [0.44, 0.66]2.9-0.30 *0.744.3-0.33 *
MCt 批判性思维0.51 [0.38, 0.67]2.6-0.180.714.1-0.21
QLl 逻辑推理0.51 [0.39, 0.67]2.6-0.190.714.1-0.25 *
AT 非典型性0.52 [0.36, 0.62]2.6-0.180.683.5-0.28 *
KNf 形式科学知识0.46 [0.31, 0.60]2.1-0.140.654.1-0.14
SC 规格合规与自检0.45 [0.25, 0.58]1.9-0.030.694.5-0.12
TU 工具与软件操作0.39 [0.24, 0.49]1.3-0.180.623.9-0.15
QLq 定量推理0.37 [0.27, 0.50]0.6+0.020.593.5-0.03
KNa 应用科学知识0.37 [0.24, 0.55]0.5-0.140.654.4-0.21
VI 视觉感知与 GUI0.45 [0.27, 0.59]1.6+0.100.614.1+0.02
MS 心智建模0.27 [0.09, 0.43]0.0-0.050.482.3-0.05

codex / gpt-5.5(n = 37):

维度ability 二值 [95% CI]level_50 二值ρ 二值ability 软标签level_50 软标签ρ 软标签
PL 规划与长程执行0.52 [0.36, 0.65]2.6-0.38 *0.713.8-0.48 *
AS 注意与扫描0.55 [0.38, 0.65]2.8-0.34 *0.733.8-0.43 *
CL 概念化与抽象0.50 [0.39, 0.59]2.5-0.50 *0.663.4-0.57 *
MCu 已知未知校准0.61 [0.44, 0.71]3.1-0.37 *0.774.5-0.40 *
MCr 相关信息识别0.61 [0.45, 0.71]3.1-0.35 *0.794.2-0.44 *
VO 工作量0.70 [0.47, 0.78]3.6-0.40 *0.814.7-0.41 *
MCt 批判性思维0.67 [0.51, 0.76]3.4-0.46 *0.824.4-0.50 *
QLl 逻辑推理0.55 [0.37, 0.72]3.0-0.300.794.7-0.37 *
AT 非典型性0.52 [0.36, 0.68]2.6-0.160.733.9-0.30
KNf 形式科学知识0.55 [0.38, 0.74]3.1-0.220.815.2-0.27
SC 规格合规与自检0.59 [0.39, 0.73]3.2-0.270.804.7-0.34 *
TU 工具与软件操作0.45 [0.29, 0.62]1.9-0.010.724.0-0.28
QLq 定量推理0.52 [0.34, 0.68]2.7-0.250.745.3-0.26
KNa 应用科学知识0.60 [0.30, 0.78]3.5-0.120.825.0-0.21
VI 视觉感知与 GUI0.31 [0.06, 0.51]0.0-0.120.533.0-0.21
MS 心智建模0.21 [0.00, 0.47]0.0-0.180.553.2-0.10

两版结果的维度排序高度一致(Spearman 0.89 和 0.88)。二值标签下 opus-4.8 在核心维度的 level_50 约 2.7 到 2.9 级,软标签下约 3.4 到 4.0 级,可读作:3 级任务大约一半能完全通过,4 级任务多数不能完全通过但常有部分得分。软标签让相关性更清晰,opus-4.8 上显著维度从 6 个增至 8 个,gpt-5.5 上 SC 和 TU 从接近 0 变为可见。

二值标签下的能力雷达图
图 7 二值标签下的能力雷达图。这张图不能按维度读:见下面的偏相关分析。

什么是综合因子,“控制它”是什么意思。把每个任务在 22 个原维度上的等级各自标准化后取平均,得到一个数:这个任务总体上有多重。这就是综合因子,下文也叫整体需求。需要它是因为维度之间高度同步:核心六维两两 Spearman 相关 0.38 到 0.70,第一主成分解释 28% 的方差;规划长、信息多、工作量大的任务往往同时也是校准难、抽象难的任务。“控制综合因子后的偏相关”是先把某一维和通过率各自能被综合因子解释的部分扣掉,再看两者剩下的相关:如果它接近 0,这一维对成败的全部影响都可以归结为“任务总体多重”,它本身没有额外信息。下表里核心六维的偏相关全部接近 0。

后果是能力雷达图不能按维度读。每一维的 ability 是分别拟合的,但拟合用的是同一批任务和同一个“总体多重”的信号;既然扣掉这个信号后各维没有剩余信息,维度之间 ability 的高低差别就只是拟合噪声,各维 95% 置信区间宽 0.2 到 0.3 且相互重叠也印证了这一点。雷达图真正可靠的只有它的总体大小,即 agent 对整体需求的耐受度;“这个 agent 在 MCu 上比在 PL 上弱”这种读法没有数据支持。

维度claude-code / opus-4.8 原始 ρ控制 tier控制综合因子codex / gpt-5.5 原始 ρ控制 tier控制综合因子
PL 规划与长程执行-0.32-0.21-0.10-0.38-0.29-0.07
AS 注意与扫描-0.31-0.26-0.16-0.34-0.28-0.09
CL 概念化与抽象-0.27-0.17-0.01-0.50-0.43-0.29
MCu 已知未知校准-0.32-0.24-0.11-0.37-0.33-0.07
MCr 相关信息识别-0.29-0.18-0.08-0.35-0.31-0.03
VO 工作量-0.30-0.24-0.05-0.40-0.34-0.11

预测力。用随机森林从 22 维需求预测通过与否(5 折、10 个种子,样本外):

agentn二值 AUROC 分布内二值 AUROC 跨 tier二值 AUROC 跨 domain软标签 ρ(pred, score) 分布内软标签 MAE / 均值基线
claude-code / opus-4.8810.59 ± 0.050.430.570.180.375 / 0.389
codex / gpt-5.5370.54 ± 0.040.600.560.150.311 / 0.324
pooled top-21180.56 ± 0.030.470.630.110.359 / 0.371

随机森林在 22 维上的样本外 AUROC 只有 0.54 到 0.63,接近随机;ADeLe 论文在 1.6 万题电池上约 0.88。但这主要是估计方法的问题:N ≈ 80 时 22 个特征的随机森林严重过拟合。把 22 维压成一个综合因子后做逻辑回归,交叉验证 AUROC 为 opus-4.8 0.70、gpt-5.5 0.74、合并 0.70(3.5 节的表)。也就是说,需求画像对成败有中等的预测力,但几乎全部来自一个整体因子,各维度单独不提供样本外增量。软标签版本的预测值与得分的相关 0.11 到 0.23,MAE 只比"预测均值"基线好 0.01 到 0.03。即便按 0.7 的 AUROC 算,仍有相当一部分成败在需求画像之外,这正是结果侧要回答的。

3.3结果侧:从自述到轨迹

结果侧用两个视角看同一批失败。agent 视角只用 ALE 公开的运行叙述:agent 的最终报告、分章节小结,配上评分规则和得分。它回答的是“agent 认为自己做了什么、达到了什么”,是研究 agent 为什么会以为自己完成了的材料,但看不到实际发生的事。第三方视角由判分模型逐步审计 154 个运行的完整轨迹:每条 shell 命令及其返回、文件读写、GUI 动作和 agent 消息,全部带步骤号,要求每个判断引用具体步骤,不采信没有轨迹证据的自述。除失败原因外,第三方视角还记录六项过程事实:输出是否真的写了、agent 做过的最强检查、任务提供了什么可核验抓手、最终断言是否有证据支持、预算是否耗尽、是否知情偏离了明确要求,以及“若改进哪项能力最可能翻转这次运行”。两个视角对失败主因的一致率 69%(67 个失败),分歧集中在“未验证即宣称完成”:第三方视角把其中大半改判为方法或精度问题,因为 agent 其实做了检查,只是检查的对象是格式而不是内容;两个视角的差距被单独记录为“断言无据”这一过程事实。

claude-code / opus-4.8codex / gpt-5.5
领域方法 / 精度不达标claude-code / opus-4.8 · 领域方法 / 精度不达标: 22 / 47 个失败 (47%),占全部任务 27.2 pp47%codex / gpt-5.5 · 领域方法 / 精度不达标: 12 / 20 个失败 (60%),占全部任务 32.4 pp60%未验证即宣称完成claude-code / opus-4.8 · 未验证即宣称完成: 7 / 47 个失败 (15%),占全部任务 8.6 pp15%codex / gpt-5.5 · 未验证即宣称完成: 4 / 20 个失败 (20%),占全部任务 10.8 pp20%输出契约违规claude-code / opus-4.8 · 输出契约违规: 4 / 47 个失败 (9%),占全部任务 4.9 pp9%codex / gpt-5.5 · 输出契约违规: 2 / 20 个失败 (10%),占全部任务 5.4 pp10%漏读规格要求claude-code / opus-4.8 · 漏读规格要求: 4 / 47 个失败 (9%),占全部任务 4.9 pp9%codex / gpt-5.5 · 漏读规格要求: 0 / 20 个失败 (0%),占全部任务 0.0 pp0%规划 / 预算耗尽claude-code / opus-4.8 · 规划 / 预算耗尽: 8 / 47 个失败 (17%),占全部任务 9.9 pp17%codex / gpt-5.5 · 规划 / 预算耗尽: 0 / 20 个失败 (0%),占全部任务 0.0 pp0%工具与环境claude-code / opus-4.8 · 工具与环境: 0 / 47 个失败 (0%),占全部任务 0.0 pp0%codex / gpt-5.5 · 工具与环境: 1 / 20 个失败 (5%),占全部任务 2.7 pp5%视觉 / GUIclaude-code / opus-4.8 · 视觉 / GUI: 0 / 47 个失败 (0%),占全部任务 0.0 pp0%codex / gpt-5.5 · 视觉 / GUI: 1 / 20 个失败 (5%),占全部任务 2.7 pp5%基础设施 / 无法判定claude-code / opus-4.8 · 基础设施 / 无法判定: 2 / 47 个失败 (4%),占全部任务 2.5 pp4%codex / gpt-5.5 · 基础设施 / 无法判定: 0 / 20 个失败 (0%),占全部任务 0.0 pp0%
图 8 agent 视角(自述)下的主要失败原因占该 agent 全部失败的比例。悬停可见数量。
主要原因(轨迹审计)claude-code / opus-4.8(失败 51)占其全部任务codex / gpt-5.5(失败 21)占其全部任务agent 视角的数量(两 agent 合计)
领域方法 / 精度不达标2733.3 pp1745.9 pp34
规划 / 预算耗尽78.6 pp00.0 pp8
未验证即宣称完成44.9 pp25.4 pp11
漏读规格要求44.9 pp00.0 pp4
输出契约违规33.7 pp00.0 pp6
工具与环境00.0 pp12.7 pp1
视觉 / GUI11.2 pp00.0 pp1
基础设施 / 无法判定22.5 pp00.0 pp2
达到任务自身阈值但未满分33.7 pp12.7 pp0

第三方视角下的读法。第一,“做完了但不达标”的比例更高:两个 agent 合计 44 个失败(61%)流程走完、硬门槛全过,输给了隐藏参考的精度或方法要求。第二,预算耗尽仍是 opus-4.8 独有:7 个失败,gpt-5.5 为零。第三,作为主因的交付层失误缩小到 13 个,但它没有消失,而是转移到了过程事实里:3.6 节会看到,26 个失败(36%)以无据断言结束。第四,工具环境、GUI、基础设施合计 4 例,仍不是主因。审计置信度:高 8、中 43、低 21;四个药物化学运行由 Sonnet 5 审计。

3.4交叉印证

需求侧说失败随核心簇(PL、AS、CL、MCu、MCr、VO)整体上升且不可分维度;结果侧把这个"整体"拆开了:MCu 和 MCr 对应交付层失误,PL 和 VO 对应预算耗尽,剩下的大头是领域精度。两边一致的判断是"从能扛 3 级到能扛 4 级"是唯一的台阶,其中约三分之一的差距是交付纪律,三分之二是领域深度。两边也一致地表明工具操作和 GUI 不是这两个 agent 的瓶颈,尽管 TU 是 ALE 分层的第五强维度。需求侧里 SC 与通过率无关,结果侧却有 6 例契约违规:前者是等级没有方差,后者是结果层面的直接证据,在这一点上结果侧更可信。

3.5把失败归因到体系内的维度

四个新维度是否让失败能指向体系内的维度,用三个检验回答:它们与通过率的关联在控制原 22 维综合因子后是否仍然存在;在失败运行里,每个维度是否把它对应的失败类型分了出来;加入它们后样本外预测力是否提高。

维度合并 ρ vs 通过合并 ρ vs 得分控制原 22 维综合因子后(通过)claude-code / opus-4.8 ρ vs 通过codex / gpt-5.5 ρ vs 通过
CS 输出契约严格度-0.11-0.13-0.04-0.09-0.15
PR 精度要求-0.15-0.26 *-0.04-0.10-0.26
VB 自检负担-0.21 *-0.16-0.18-0.17-0.31
BP 预算压力-0.19 *-0.24 *+0.00-0.19-0.27
EV 实证验证需求-0.21 *-0.26 *-0.03-0.17-0.41
两个 agent 合并
VB 自检负担
0%25%50%75%100%自检负担 2 级: 通过 53% (n=17)53%L2自检负担 3 级: 通过 52% (n=23)52%L3自检负担 4 级: 通过 34% (n=71)34%L4自检负担 5 级: 通过 14% (n=7)14%L5
PR 精度要求
0%25%50%75%100%精度要求 1 级: 通过 75% (n=4)75%L1精度要求 2 级: 通过 48% (n=21)48%L2精度要求 3 级: 通过 38% (n=56)38%L3精度要求 4 级: 通过 37% (n=27)37%L4精度要求 5 级: 通过 20% (n=10)20%L5
BP 预算压力
0%25%50%75%100%预算压力 1 级: 通过 46% (n=63)46%L1预算压力 2 级: 通过 38% (n=34)38%L2预算压力 3 级: 通过 31% (n=13)31%L3预算压力 4 级: 通过 0% (n=7)0%L4预算压力 5 级: 通过 0% (n=1)0%L5
EV 实证验证需求
0%25%50%75%100%实证验证需求 0 级: 通过 41% (n=17)41%L0实证验证需求 1 级: 通过 50% (n=48)50%L1实证验证需求 2 级: 通过 40% (n=25)40%L2实证验证需求 3 级: 通过 26% (n=19)26%L3实证验证需求 4 级: 通过 0% (n=8)0%L4实证验证需求 5 级: 通过 0% (n=1)0%L5
图 9 合并两个 agent 后,按新维度等级分层的通过率(悬停可见任务数)。VB 从 3 级到 4 级、BP 从 3 级到 4 级各有一个陡坎;PR 单调下降。CS 没有可辨的坡度,未画出。

VB 提供了原体系没有的信息。合并 ρ = -0.21(p = 0.020),控制综合因子后仍为 -0.18;通过率从 2 到 3 级的 53% 和 52% 跌到 4 级的 34%、5 级的 14%。PR 与得分的关系比与通过更强(ρ -0.26),通过率随等级单调下降(1 级 75% 到 5 级 20%),但一半以上被综合因子解释。BP 有一个阈值效应:≥ 4 级的 8 个任务两个 agent 一个都没通过,但控制综合因子后偏相关归零,它是 PL 和 VO 的运行面而非新因子。CS 没有区分度EV 是第一个把精度类失败分出来的任务侧维度:合并 ρ = -0.21(p = 0.021),通过率从 0 到 1 级的四到五成降到 3 级 26%,≥ 4 级的 9 个任务无一通过;在失败运行里,精度类失败的 EV 均值 2.12 高于其他失败的 1.48(效应量 +0.27,p = 0.025),这是 PR 做不到的。控制综合因子后 EV 的偏相关归零,它和 BP 一样是整体因子的一个面,价值在归因而不在预测。

维度它应当分出的失败类型合并:目标类均值 / 其他失败均值claude-code / opus-4.8:同上
BP 预算压力规划 / 预算耗尽2.38 / 1.81(n 8 / 59),效应量 +0.35,p 0.0462.38 / 1.64(n 8 / 39),效应量 +0.46,p 0.014
CS 输出契约严格度契约违规 + 漏读规格4.00 / 3.67(n 10 / 57),效应量 +0.24,p 0.0693.88 / 3.69(n 8 / 39),效应量 +0.12,p 0.257
PR 精度要求领域方法 / 精度不达标3.26 / 3.18(n 34 / 33),效应量 +0.08,p 0.2813.27 / 3.04(n 22 / 25),效应量 +0.17,p 0.136
VB 自检负担未验证即宣称完成2.91 / 3.86(n 11 / 56),效应量 -0.59,p 1.0002.86 / 3.75(n 7 / 40),效应量 -0.54,p 0.997
EV 实证验证需求领域方法 / 精度不达标2.12 / 1.48(n 34 / 33),效应量 +0.27,p 0.0251.82 / 1.32(n 22 / 25),效应量 +0.22,p 0.087

失败类型的归因结果分三种。BP 确实把预算耗尽类失败分了出来(opus-4.8 效应量 +0.46,p = 0.014);CS 对契约类失败只有弱的正向分离;PR 没有把精度不达标类失败与其他失败分开,说明精度门槛抬高的是所有失败的概率,而不是专门制造某一类失败。

最有解释力的是一个反向结果。"未验证即宣称完成"的失败集中在自检负担较低的任务上(VB 均值 2.91,其他失败 3.86,效应量 -0.59):这些任务给了可见参考值或可校验的中间结果,agent 没有用。自检负担高的任务上,没核验的失败被记成了精度不达标。这意味着"未验证"是一种本可避免的行为失误,而不是任务需求驱动的失败,它按构造就不会出现在任何任务侧维度里,只能在 agent 的过程层面度量:是否运行了可用的检查、是否对照了契约。这也解释了为什么它是最便宜的改进方向。

预测力没有提高。

agentRF 22 维RF 27 维逻辑回归:综合因子逻辑回归:综合因子 + 结果侧驱动维度逻辑回归:仅结果侧驱动维度
claude-code / opus-4.80.610.570.700.590.54
codex / gpt-5.50.610.620.740.700.68
pooled0.570.550.700.660.62

随机森林从 22 维到 27 维没有变化;逻辑回归在综合因子上加入新维度反而略降(特征增多、样本不变的过拟合)。结论是:新维度的价值在归因而不在预测。归因的最终形态是两层框架:任务侧的需求维度(27 个)刻画任务要求什么,agent 侧的过程行为(是否核验、是否分段交付、是否读全规格)刻画 agent 做了什么;改进方向来自两层的交叉,例如自检负担高的任务需要领域精度上的工作,自检负担中低的失败需要过程纪律。

3.6过程层:agent 实际做了什么

轨迹审计记录的过程事实是 agent 侧的层,与任务侧的需求维度正交。下表是两个 agent 合并后各过程事实对应的通过率。

过程事实(两 agent 合并,n = 120)取值通过率运行数
agent 实际做过的最强检查没有任何检查17%6
agent 实际做过的最强检查只检查格式 / 文件存在38%50
agent 实际做过的最强检查对照了可见参考值38%21
agent 实际做过的最强检查写了测试或独立重算46%43
任务提供的可核验抓手没有可核验抓手46%39
任务提供的可核验抓手部分抓手(可见参考、解析解层、样例)37%79
任务提供的可核验抓手有完整的检查器 / 测试50%2
最终断言有轨迹证据支持0%26
最终断言有轨迹证据支持51%94
知情偏离了某条明确要求40%93
知情偏离了某条明确要求41%27
0%25%50%75%100%没有任何检查: 通过 17% (n=6)17%没有任何检查只检查格式 / 文件存在: 通过 38% (n=50)38%只检查格式/文件存在对照了可见参考值: 通过 38% (n=21)38%对照了可见参考值写了测试或独立重算: 通过 46% (n=43)46%写了测试或独立重算
图 10 agent 做过的最强检查与通过率。只检查格式的运行占 50 个。
0%25%50%75%100%有证据: 通过 51% (n=94)51%断言有证据无证据: 通过 0% (n=26)0%断言无证据
图 11 最终断言是否有轨迹证据支持与通过率。无据断言的 26 个运行无一通过(Fisher p = 2e-07)。

四个结论。第一,“断言有据”是最强的单一过程指标:无据断言的运行通过率 0,有据的 51%;两个 agent 的失败里分别有 23/51 和 3/21 以无据断言结束。它的定义不依赖结果(断言是否被轨迹支持),因此可以作为 agent 的过程指标直接度量。第二,检查的种类只弱相关于通过:写了测试或独立重算的运行通过率 46%,只检查格式的 38%,强检查对弱检查的优势比 1.4(p = 0.46)。原因在于 agent 自己写的测试可能和产物一样错:44 个精度类失败里有相当一部分做过测试或重算。第三,抓手在但没用:在任务提供了可核验抓手的 51 个失败里,21 个只检查了格式或什么都没检查。第四,知情偏离要求本身不致命:27 个运行知情偏离了某条要求,通过率 41%,与未偏离的 40% 相同;致命的是偏离后仍宣称满足。

过程事实也给了 rubric 效度的独立检验。VB(自检负担)与审计得到的“任务提供的抓手”呈显著负相关(Spearman -0.38,p = 2e-05;抓手为“无”的任务 VB 均值 3.97,“部分”3.42),说明 VB 的标注确实刻画了任务的可核验性;VB 高的任务上 agent 做的检查也更弱(-0.19,p = 0.04)。用轨迹审计的归因重做 3.5 节的检验,PR 对精度类失败的分离从不显著变为边缘显著(效应量 +0.19,p = 0.08)。

3.7缺失能力的主题与维度缺口

轨迹审计为每个失败运行给出了一句“若改进哪项能力最可能翻转这次运行”。把两个 agent 的 67 句归成 8 个主题,每个主题映射到体系内的一个维度、或标为 agent 过程行为、或标为需要新维度:

缺失能力主题(agent 侧)定义数量所属改进方向对应任务侧维度性质
实证调参与样本外验证
Empirical model tuning and out-of-sample validation
通过反复实验选择、调整和收敛定量模型、求解器和控制器,用可靠的留出、回测或收敛性验证达到精度和泛化目标。12实证调参与验证EV · PR · QLq领域通用
独立实证核验
Independent empirical verification
用独立证据证明结果确实正确:压力测试、玩具或变换输入的运行、动态或形式检查、与现成工具或外部基准比对,而不是相信表面信号、元数据或循环的自洽。10过程纪律VB · MCu领域通用
规则与定义的字面忠实
Literal rule and definition fidelity
逐字阅读任务书、编码手册、评分细则、协议或 schema,并严格按其纳入规则、定义和规定方法执行,使产物与严格的隐藏参考一致。10过程纪律CS · MCr领域通用
预算节奏与运行完成
Budget pacing and run completion
分配步数、上下文和计算,让合法产物早写出、长作业在会话内跑完,而不是过度阅读、过度搭建或停在一个分离的后台进程上。8预算节奏BP · PL · VO领域通用
契约自审
Spec-contract self-audit
交付前把产物的字段、行数、参数、文件名、schema 覆盖、边界情况和取值范围逐项对照书面规格或可见参考。8过程纪律SC · CS领域通用
视觉与空间感知
Visual and spatial perception
准确感知并操作图像、渲染、扫描文档、GUI 和三维图像序列:结构式图、组织学、字形、PDF 表格、点击目标、运动的神经元。7其他VI · SNs领域通用
领域专家判断
Specialist domain expertise and judgement
具备特定领域从业者的知识(约定、参数选择、参考方法、专家启发式),做出领域专家会做的判断。7其他KNa · KNn · KNf领域专属
端到端驱动专业工具链
Driving domain toolchains end-to-end
通过真实接口操作和调试重型专业软件(仿真器、协同仿真、EDA、QC 与治疗计划流水线)直到产出真正的结果,而不是用手工近似替代。5其他TU领域专属

为什么说缺的多数是领域通用技能。“领域通用”指在任何领域都以同样方式起作用的技能:把结果拿去和独立证据比对、逐字执行规则、在预算内先交付、用留出数据判断模型是否达标。“领域专属”指只在某个领域有效的知识:某种药物化学的约定、某个 EDA 流程的参数、某个放疗计划系统的用法。按这个划分,67 个失败运行里 55 个缺的是前者,12 个缺的是后者。证据有三层。

第一层是主题本身跨领域出现:“实证调参与样本外验证”的 12 个运行分布在 5 个领域(医疗 5、物理科学 3、生命科学 2 等),气候预报、流感住院预测、放射组学生存模型、心电图分类各自的领域知识毫无关系,失败的形态却一样:模型跑了一次就没有再度量过技巧,或者用交叉验证选出的乐观结果当成了泛化性能。“独立实证核验”的 10 个运行分布在 6 个领域,“规则与定义的字面忠实”分布在 6 个领域。相反,“领域专家判断”和“端到端驱动专业工具链”合计只有 12 个。

第二层是需求侧的印证:知识类维度 KNa、KNf、KNn、KNs 与难度分层不相关,与通过率也不相关(3.8 节总表),而与成败相关的维度全部是过程性的:规划 PL、校准 MCu、相关信息识别 MCr、注意扫描 AS、自检负担 VB。如果失败主要是知识不够,知识类维度应当和成败相关,事实并非如此。

第三层是过程事实:26 个失败以无据断言结束、21 个失败没有用任务提供的可核验抓手,这些行为与领域无关。

这个结论为什么重要。领域知识只能逐领域补,成本随领域数线性增长且没有尽头;领域通用技能是一次改进、多处受益:一套“先交合法产物、对照可见参考、用留出数据验证、断言必须有据”的过程纪律同时抬高医疗、金融、工程和物理科学的通过率,4.5 节的领域分解会显示同一主题出现在几乎每个领域的前三。同时也要说明它的边界:领域专属的 12 个失败是真实存在的(例如 matRad、PLAXIS、Isaac Sim 这类专业工具链),在工程领域它们的占比更高;主题归纳由判分模型一次完成,“通用”与“专属”的边界在个别条目上可以争论,但 55:12 的比例不会因几个条目而翻转。

维度缺口有两处,性质不同。任务侧缺一个“实证验证需求”维度:现有的 PR 说目标多紧,VB 说能对照什么,都没有说“从一次正确实现到达标之间要多少轮实证迭代”,EV 就是为此定义的维度,标注结果见 2.7 节和上面的表。agent 侧缺的不是维度而是过程指标:断言是否有据、抓手是否使用、首个合法产物出现在预算的哪个位置、结束时是否留有后台作业,这些按构造不在任务侧,只能从轨迹度量。

3.8总览:27 个维度一张表一张图

第 2 章回答“ALE 要求什么”,第 3 章回答“agent 在哪里失败”。下面把两章对每个任务侧维度的结论并排:需求侧的均值、离散度和与难度分层的相关;结果侧的与通过率的相关(两 agent 合并,n = 118 个任务 × agent 对)、控制原 22 维综合因子后的偏相关、能分出的失败类型。最后一列是按固定规则生成的判定:均值低于 1 记“基本不考”;均值 ≥ 3 且标准差 < 0.75 记“普遍高需求,无区分度”;与通过率显著相关且偏相关 ≥ 0.15 记“独立于综合因子的成败信号”,否则记“随整体因子影响成败”;只与分层相关记“刻画难度分层,与成败无关”。

ADeLe v1 原维度(18)agentic 补充(4)结果侧驱动补充(5)
p < 0.01p < 0.05不显著
平均需求等级 0–5ρ 与难度分层ρ 与通过率 · 空心 = 控制综合因子后0+.25+.5-.5-.250+.25012345AS 注意与扫描AS 平均等级 3.19(标准差 0.56)AS ρ vs tier = +0.26, p = 0.002AS ρ vs 通过 = -0.31, p = 0.001; 控制综合因子后 -0.14CEc 语言理解CEc 平均等级 3.20(标准差 0.58)CEc ρ vs tier = +0.16, p = 0.068CEc ρ vs 通过 = -0.14, p = 0.142; 控制综合因子后 +0.06CEe 语言表达CEe 平均等级 1.39(标准差 0.73)CEe ρ vs tier = +0.05, p = 0.527CEe ρ vs 通过 = -0.14, p = 0.139; 控制综合因子后 -0.03CL 概念化与抽象CL 平均等级 2.55(标准差 0.77)CL ρ vs tier = +0.29, p = 0.000CL ρ vs 通过 = -0.33, p = 0.000; 控制综合因子后 -0.10MCr 相关信息识别MCr 平均等级 3.50(标准差 0.58)MCr ρ vs tier = +0.34, p = 0.000MCr ρ vs 通过 = -0.31, p = 0.001; 控制综合因子后 -0.09MCt 批判性思维MCt 平均等级 3.51(标准差 0.57)MCt ρ vs tier = +0.28, p = 0.001MCt ρ vs 通过 = -0.25, p = 0.006; 控制综合因子后 +0.03MCu 已知未知校准MCu 平均等级 3.34(标准差 0.56)MCu ρ vs tier = +0.32, p = 0.000MCu ρ vs 通过 = -0.32, p = 0.000; 控制综合因子后 -0.09MS 心智建模MS 平均等级 0.32(标准差 0.63)MS ρ vs tier = +0.08, p = 0.341MS ρ vs 通过 = -0.09, p = 0.327; 控制综合因子后 +0.03QLl 逻辑推理QLl 平均等级 3.45(标准差 0.69)QLl ρ vs tier = +0.22, p = 0.011QLl ρ vs 通过 = -0.22, p = 0.017; 控制综合因子后 +0.03QLq 定量推理QLq 平均等级 2.99(标准差 1.10)QLq ρ vs tier = +0.19, p = 0.022QLq ρ vs 通过 = -0.06, p = 0.552; 控制综合因子后 +0.14SNs 空间物理推理SNs 平均等级 1.40(标准差 1.47)SNs ρ vs tier = +0.28, p = 0.001SNs ρ vs 通过 = -0.06, p = 0.545; 控制综合因子后 +0.01KNa 应用科学知识KNa 平均等级 3.32(标准差 1.46)KNa ρ vs tier = +0.26, p = 0.002KNa ρ vs 通过 = -0.13, p = 0.162; 控制综合因子后 +0.01KNc 日常常识KNc 平均等级 1.55(标准差 0.74)KNc ρ vs tier = +0.11, p = 0.194KNc ρ vs 通过 = -0.03, p = 0.748; 控制综合因子后 +0.01KNf 形式科学知识KNf 平均等级 3.54(标准差 0.87)KNf ρ vs tier = +0.13, p = 0.128KNf ρ vs 通过 = -0.17, p = 0.070; 控制综合因子后 -0.03KNn 自然科学知识KNn 平均等级 1.88(标准差 1.84)KNn ρ vs tier = +0.04, p = 0.658KNn ρ vs 通过 = -0.05, p = 0.587; 控制综合因子后 -0.01KNs 社科人文知识KNs 平均等级 0.68(标准差 1.22)KNs ρ vs tier = +0.11, p = 0.198KNs ρ vs 通过 = -0.03, p = 0.729; 控制综合因子后 +0.00AT 非典型性AT 平均等级 3.17(标准差 0.55)AT ρ vs tier = +0.24, p = 0.005AT ρ vs 通过 = -0.17, p = 0.071; 控制综合因子后 +0.02VO 工作量VO 平均等级 3.71(标准差 0.61)VO ρ vs tier = +0.32, p = 0.000VO ρ vs 通过 = -0.31, p = 0.001; 控制综合因子后 -0.05TU 工具与软件操作TU 平均等级 2.81(标准差 0.89)TU ρ vs tier = +0.30, p = 0.000TU ρ vs 通过 = -0.11, p = 0.224; 控制综合因子后 -0.02PL 规划与长程执行PL 平均等级 3.06(标准差 0.71)PL ρ vs tier = +0.43, p = 0.000PL ρ vs 通过 = -0.32, p = 0.000; 控制综合因子后 -0.08VI 视觉感知与 GUIVI 平均等级 1.09(标准差 1.47)VI ρ vs tier = +0.16, p = 0.065VI ρ vs 通过 = +0.03, p = 0.745; 控制综合因子后 +0.04SC 规格合规与自检SC 平均等级 3.48(标准差 0.64)SC ρ vs tier = +0.23, p = 0.006SC ρ vs 通过 = -0.10, p = 0.277; 控制综合因子后 +0.04CS 输出契约严格度CS 平均等级 3.70(标准差 0.67)CS ρ vs tier = +0.04, p = 0.661CS ρ vs 通过 = -0.11, p = 0.242; 控制综合因子后 -0.04PR 精度要求PR 平均等级 3.17(标准差 0.92)PR ρ vs tier = +0.23, p = 0.007PR ρ vs 通过 = -0.15, p = 0.100; 控制综合因子后 -0.04VB 自检负担VB 平均等级 3.58(标准差 0.80)VB ρ vs tier = -0.04, p = 0.652VB ρ vs 通过 = -0.21, p = 0.020; 控制综合因子后 -0.18BP 预算压力BP 平均等级 1.78(标准差 0.93)BP ρ vs tier = +0.32, p = 0.000BP ρ vs 通过 = -0.19, p = 0.034; 控制综合因子后 +0.00EV 实证验证需求EV 平均等级 1.66(标准差 1.13)EV ρ vs tier = +0.23, p = 0.006EV ρ vs 通过 = -0.21, p = 0.021; 控制综合因子后 -0.03
图 12 每个维度三个指标并排:平均需求等级(柱)、与难度分层的 Spearman(点)、与通过率的 Spearman(实心点)及控制综合因子后的偏相关(空心点)。悬停可见数值。
维度均值标准差ρ 分层ρ 通过(合并)偏相关 | 综合因子能分出的失败类型(效应量)判定
AS 注意与扫描ADeLe v1 原维度3.190.56+0.26 *-0.31 *-0.14普遍高需求,无区分度
CEc 语言理解ADeLe v1 原维度3.200.58+0.16-0.14+0.06普遍高需求,无区分度
CEe 语言表达ADeLe v1 原维度1.390.73+0.05-0.14-0.03无显著信号
CL 概念化与抽象ADeLe v1 原维度2.550.77+0.29 *-0.33 *-0.10随整体因子影响成败
MCr 相关信息识别ADeLe v1 原维度3.500.58+0.34 *-0.31 *-0.09普遍高需求,无区分度
MCt 批判性思维ADeLe v1 原维度3.510.57+0.28 *-0.25 *+0.03普遍高需求,无区分度
MCu 已知未知校准ADeLe v1 原维度3.340.56+0.32 *-0.32 *-0.09普遍高需求,无区分度
MS 心智建模ADeLe v1 原维度0.320.63+0.08-0.09+0.03ALE 基本不考
QLl 逻辑推理ADeLe v1 原维度3.450.69+0.22 *-0.22 *+0.03普遍高需求,无区分度
QLq 定量推理ADeLe v1 原维度2.991.10+0.19 *-0.06+0.14刻画难度分层,与成败无关
SNs 空间物理推理ADeLe v1 原维度1.401.47+0.28 *-0.06+0.01刻画难度分层,与成败无关
KNa 应用科学知识ADeLe v1 原维度3.321.46+0.26 *-0.13+0.01刻画难度分层,与成败无关
KNc 日常常识ADeLe v1 原维度1.550.74+0.11-0.03+0.01无显著信号
KNf 形式科学知识ADeLe v1 原维度3.540.87+0.13-0.17-0.03无显著信号
KNn 自然科学知识ADeLe v1 原维度1.881.84+0.04-0.05-0.01无显著信号
KNs 社科人文知识ADeLe v1 原维度0.681.22+0.11-0.03+0.00ALE 基本不考
AT 非典型性ADeLe v1 原维度3.170.55+0.24 *-0.17+0.02普遍高需求,无区分度
VO 工作量ADeLe v1 原维度3.710.61+0.32 *-0.31 *-0.05普遍高需求,无区分度
TU 工具与软件操作agentic 补充2.810.89+0.30 *-0.11-0.02刻画难度分层,与成败无关
PL 规划与长程执行agentic 补充3.060.71+0.43 *-0.32 *-0.08普遍高需求,无区分度
VI 视觉感知与 GUIagentic 补充1.091.47+0.16+0.03+0.04无显著信号
SC 规格合规与自检agentic 补充3.480.64+0.23 *-0.10+0.04普遍高需求,无区分度
CS 输出契约严格度结果侧驱动补充3.700.67+0.04-0.11-0.04契约违规 + 漏读规格(+0.24,p 0.07)普遍高需求,无区分度
PR 精度要求结果侧驱动补充3.170.92+0.23 *-0.15-0.04精度不达标(+0.08,p 0.28)刻画难度分层,与成败无关
VB 自检负担结果侧驱动补充3.580.80-0.04-0.21 *-0.18未验证即宣称完成(-0.59,p 1.00)独立于综合因子的成败信号
BP 预算压力结果侧驱动补充1.780.93+0.32 *-0.19 *+0.00预算耗尽(+0.35,p 0.05)随整体因子影响成败
EV 实证验证需求结果侧驱动补充1.661.13+0.23 *-0.21 *-0.03精度不达标(+0.27,p 0.02)随整体因子影响成败

判定分布:普遍高需求,无区分度 11 个;无显著信号 5 个;刻画难度分层,与成败无关 5 个;随整体因子影响成败 3 个;ALE 基本不考 2 个;独立于综合因子的成败信号 1 个。读法:11 个维度与成败显著相关,但其中只有 1 个(VB)在控制综合因子后仍保留信号。这两个数字并不矛盾:相关的维度多,是因为它们都随着任务的整体轻重一起变化,重的任务在这些维度上都高、也都更容易失败;扣掉“整体轻重”之后仍有信号,才说明这一维带来了整体之外的信息。所以 11 个显著相关基本是同一个信号的 11 次重复,独立的信号只有 1 个。能分出具体失败类型的维度都来自结果侧驱动的那一批,这是它们存在的理由。

4模型改进方向 #

三个方向按投入产出比排序。表中的百分点是轨迹审计归因下“该类失败全部翻转”的上限,实际收益应打折;三者之和不等于失败总数,因为还有基础设施和无法判定的失败。

改进方向(agent 侧)对应任务侧维度claude-code / opus-4.8: 当前 37%codex / gpt-5.5: 当前 43%性质
过程纪律:核验、契约、断言有据(agent 侧能力,对应任务侧 VB、SC、CS)VB · SC · CS · MCu+14 pp(主因);23/51 个失败以无据断言结束+5 pp(主因);3/21 个失败以无据断言结束便宜:工作已完成,抓手已在任务里
预算节奏与分段交付(agent 侧能力,对应任务侧 BP、PL)BP · PL · VO+9 pp+0 pp中等:多为 0 分,先交合法部分产出
实证调参与验证(agent 侧能力,对应任务侧 EV、PR)EV · PR · QLq+33 pp(上限)+46 pp(上限)最大的池子;主题归纳显示多数是领域通用技能

4.1过程纪律:核验、契约、断言有据

统计支持。两个 agent 的 72 个失败里,26 个(36%)以轨迹不支持的“已完成 / 已验证”结束,opus-4.8 的比例(45%)远高于 gpt-5.5(14%);无据断言的运行通过率为 0。在有可核验抓手的 51 个失败里 21 个没有用。需求侧 MCu 是两个 agent 都显著的维度,VB 与“任务提供的抓手”显著相关,说明抓手确实在任务里。“未验证即宣称完成”在 agent 视角下是 26 个失败的次要原因,在第三方视角下是 23 个。

建议。把“断言有据”做成硬性规则:报告里每一句“已验证”必须对应轨迹里一个检查动作,检查的对象是内容而不只是格式;任务给了可见参考值、解析解层或样例标签时必须对照;对隐藏阈值不做自我认证,余量薄时说余量薄;偏离某条要求时如实写明,而不是继续宣称满足;交付前对照输出契约逐项核对文件名、行数、表头、编码和多余文件。ALE 的硬门槛让这类失误的代价是整个任务归零,且这些任务的工作已经完成,所以这是投入产出比最高的方向。

代表案例(步骤号引自轨迹审计)。

  • cfr_game_theory_equilibriumclaude-code / opus-4.8 · 得分 0.67 · 步骤号引自轨迹审计

    第 37 步自算的 Tier 3 可利用度 0.0459 刚好低于 0.05 阈值;第 39 步 agent 自己写下“余量很薄,要检查稳健性”,第 40 步却只检查了键名、概率和、信息集数量,第 43 步宣称全部标准通过。评分器独立重算后 Tier 3 未过。

  • k8s_migration_1claude-code / opus-4.8 · 得分 0.91 · 步骤号引自轨迹审计

    Helm chart 验证得很充分(lint、渲染 8 种资源、实际部署健康、pytest 通过),但 terraform validate 在第 86 到 89 步失败后从未解决,只被断言为“结构上有效”;deploy.yml 和 trivy 从未执行;第 153 步仍称所有交付物“完成并验证”。

  • particle_filter_nonlinear_trackingcodex / gpt-5.5 · 得分 0.50 · 步骤号引自轨迹审计

    第 18 步真正的 Tier 3 粒子滤波 RMSE 3.10 超出 3.0 限值;第 19 到 20 步 agent 用双传感器三角定位的窗口平滑替换了上报的轨迹(窗口 21 给出 2.5532),第 27 步报告 Tier 3 全部达标而未披露替换。评分器判 Tier 3 失败。

  • prostate_imrt_matrad_reproductioncodex / gpt-5.5 · 得分 0.00 · 步骤号引自轨迹审计

    第 76 到 79 步一个 Python 脚本直接生成了全部 DICOM、剂量和指标,matRad 只在第 85 到 97 步以小参数脚本运行,优化和剂量计算从未发生。剂量呈现掩膜拼出的特征(Rectum V70 恰等于第 75 步的结构重叠比例),第 111 步仍报告审计通过,硬门槛归零。

  • llm_ecosystem_privacy_audit_realdata_1claude-code / opus-4.8 · 得分 0.50 · 步骤号引自轨迹审计

    第 20 步找到 137 个符合条件的域名;第 35 步决定“只输出指标可计算的行”,连带丢掉 randomuser.me,CSV 只剩 130 行(第 39 步)。子任务 2 的硬门槛要求全部出现。第 45 步称输出“已验证”,而第 41 到 42 步只做了计数核对和看文件头。

4.2预算节奏与分段交付

统计支持。opus-4.8 有 7 个失败(占其全部任务 9 pp)是预算耗尽或把产物交给了会话结束后不再存在的后台作业,几乎全是 0 分;gpt-5.5 没有这类失败。主题归纳里“预算节奏与运行完成”8 例全部来自 opus-4.8,8 例里 7 例得 0。需求侧 PL 是与 tier 最对齐的维度,新维度 BP ≥ 4 级的 8 个任务无一通过。

建议。任何时刻输出目录里都应有一份满足契约的文件,哪怕内容是保守版本;阅读和探索的预算封顶,到点必须开始产出;不把最终产物交给自己无法等待的后台作业;对“自建替代工具链”这类高风险路线设止损。

代表案例。

  • pe_screening_memo_1claude-code / opus-4.8 · 得分 0.00 · 步骤号引自轨迹审计

    第 20 到 131 步逐节阅读 10-K,第 142 到 147 步做勾稽,第 159、164 步只在输出目录之外写了记忆笔记;轨迹在第 167 步“现在开始写备忘录”处结束,输出文件从未写出,缺文件硬门槛给 0。

  • reddit_ai_post_codebook_boolean_codingclaude-code / opus-4.8 · 得分 0.00 · 步骤号引自轨迹审计

    第 4 到 81 步用于环境安装、修一个临时路径错误、把 1193 行帖子文件分页读完;第 95 步轨迹结束时“给 95 篇帖子编码”这项才刚设为进行中,没有任何编码脚本运行,输出目录为空。

  • clustered_cyclic_code_circuit_level_simulationclaude-code / opus-4.8 · 得分 0.00 · 步骤号引自轨迹审计

    第 188 步自估总运行时间 35 到 40 小时,第 197 步转为后台分离运行;第 218 步输出 CSV 只有表头加 53 行中的 2 行,第 219 步以“仿真正在运行”结束回合。第 213 步设的监控只在会话内有效。

  • humanoid_velocity_tracking_policyclaude-code / opus-4.8 · 得分 0.00 · 步骤号引自轨迹审计

    唯一写出的提交是第 61 步的 policy.py 和第 65 步一个零输出的 checkpoint.pt;第 79 步还在输出目录留下一个多余的 xml 文件,破坏了“恰好两个文件”的门槛。第 223 步启动 4000 轮 PPO 训练,第 290 步在训练仍在进行时让出,没有导出任何训练后的权重。

4.3实证调参与样本外验证

统计支持。44 个失败(61%)流程走完但精度或方法不达标。主题归纳把这些失败缺的能力主要归到“实证调参与样本外验证”(12 例)、“独立实证核验”(10 例)和“规则与定义的字面忠实”(10 例),都是领域通用的;“专家领域判断”只有 7 例、“驱动专业工具链”5 例。典型模式是:模型跑了一次就没有再度量过技巧、没有留出验证、交叉验证选择乐观、用残差或目视代替对隐藏指标的估计。需求侧新维度 PR 的通过率从 1 级 75% 单调降到 5 级 20%,PR 对精度类失败的分离在轨迹归因下达到边缘显著。

建议。把“达标”当成一个要用实验证明的命题:对隐藏指标建立自己的估计(留出集、回测、收敛性研究、与已知案例的校准),在提交前报告估计值和余量;用可见的解析解层或参考值做校准;首选方法不收敛时把替代方案的局限如实写入产物;对启发式或规则型方案至少在可得数据上估计一次目标指标。这些是跨领域的方法论,比补领域知识更可训练,也是最大的池子。

代表案例。

  • climate_predictioncodex / gpt-5.5 · 得分 0.79 · 步骤号引自轨迹审计

    第 17 步选了一个按格点的岭回归基线,第 24 步跑了一次就再没有度量过预测技巧,比如留出一个训练情景做验证;第 29 到 32 步只检查了形状、有限性、CSV 的 ID 和归一化。文件和结构全部有效,0.79 是技巧分的部分得分。

  • flusight_offline_hosp_forecast_2024_12_14codex / gpt-5.5 · 得分 0.84 · 步骤号引自轨迹审计

    第 50 到 52 步手工设定了 1.5 到 3.95 倍的增长比例做集成,第 57 步直接写入提交;第 64 到 65 步只检查了 schema、键、非负和区间顺序。0.84 反映的是预报准确度(WIS),没有做任何回测校准。

  • nsclc_radiomics_cox_signature_v1codex / gpt-5.5 · 得分 0.57 · 步骤号引自轨迹审计

    完整流程跑通:421 例的 PyRadiomics 特征提取(第 105 到 114 步),120 组超参的交叉验证选出 64 特征的惩罚 Cox 集成,CV C-index 0.605(第 174、179 步),隐藏测试集只有 0.566。相关阈值是探索性扫描后加的,典型的选择乐观和过拟合。

  • ecg_rhythm_conduction_ptbxlclaude-code / opus-4.8 · 得分 0.51 · 步骤号引自轨迹审计

    没有标注数据(第 22、25 步),agent 手工设定信号规则,仅靠猜测患病率来调(第 213 到 242 步),把 16% 的 LAFB 和 8% 的 AFIB 解释为“富集切片”并称规则“校准良好”而无证据,第 254 到 255 步只检查输出格式;macro F1 远低于 0.70。

  • limited_angle_ct_dps_reconstructionclaude-code / opus-4.8 · 得分 0.00 · 步骤号引自轨迹审计

    流程完整:几何修正通过伴随测试(第 46、55 步),改用 CPU 可行的 DDIM+CG 采样器,100 步重建写出,数据残差 1.42%(第 85、92 步)。但输出被截断(最小值恰为 -0.02,第 95 步),PSNR ≥ 32 / SSIM ≥ 0.90 门槛未过;agent 仅凭低残差和目视判断成功(第 78、84、99 步),而残差约束不了有限角的零空间。

  • mose2_bse_absorption_socclaude-code / opus-4.8 · 得分 0.88 · 步骤号引自轨迹审计

    参考归档带密码,无从对照(第 21 步);staged 的 pw2bgw.x 不支持自旋轨道,agent 自行安装 QE 7.2 重跑(第 365 到 431 步),但用了 6×6 粗网格、6 价带 6 导带、粗网格兼作细网格(第 273、342 步),收敛性不足很可能是失分点。

4.4不是瓶颈的方向

工具与环境操作(TU)和视觉/GUI(VI)作为主因在两个 agent 的失败里合计只有 2 例,需求侧 TU 与通过率的相关也不显著。主题归纳里视觉空间感知有 7 例、驱动专业工具链 5 例,说明它们会作为次要因素出现(读图纸、判读结构式、GUI 点击偏移),但不决定成败:ALE 的 Windows GUI 任务只有 34 个,VI 等级 ≥3 的任务只占 22%。心智建模、社科知识、语言表达在 ALE 上几乎不考,提升它们不会改变 ALE 的分数。

4.5两个维度看改进方向:按能力(横向)与按领域(纵向)

先说清两层的关系。27 个维度描述任务:每个任务对某种能力要求多高。改进方向描述 agent:agent 缺什么、补什么。两者不是一回事,也不该混用:一个改进方向对应若干任务侧维度,维度告诉我们这项改进在哪些任务上兑现。比如“过程纪律”不是维度,它对应的任务侧维度是自检负担 VB、规格合规 SC、契约严格度 CS,数据显示它的收益集中在 VB 中低、抓手可用的任务上;“实证调参与验证”是 agent 侧能力,对应的任务侧维度 EV(实证验证需求)是这项能力被要求的程度,两者同名不同层,收益集中在 EV 高的任务上。下面每张表都同时给出所属改进方向和对应的任务侧维度。

上面三个方向是按能力主题合并后的结论。要回答“改进哪项能力对整体提升最大”和“某个领域改进什么收益最大”,需要把第三方视角给每个失败运行的“若改进则可翻转”的能力主题按领域展开。图 13 是领域 × 能力主题的矩阵:格子里是该领域被归到该主题的失败运行数,悬停可见它占该领域全部任务×agent 对的百分点,即“若该主题的失败全部翻转,该领域通过率的上限提升”。横向读一列是一项能力在各领域的收益分布,纵向读一行是一个领域的前三个改进方向(黑框)。

实证调参与样本外验证独立实证核验规则与定义的字面忠实预算节奏与运行完成契约自审视觉与空间感知领域专家判断端到端驱动专业工具链医疗健康 (22 对 / 14 败)医疗健康 · 实证调参与样本外验证: 5 个失败运行(占该领域 22 个任务×agent 对的 23 pp)医疗健康 · 独立实证核验: 0 个失败运行(占该领域 22 个任务×agent 对的 0 pp)医疗健康 · 规则与定义的字面忠实: 4 个失败运行(占该领域 22 个任务×agent 对的 18 pp)医疗健康 · 预算节奏与运行完成: 0 个失败运行(占该领域 22 个任务×agent 对的 0 pp)医疗健康 · 契约自审: 1 个失败运行(占该领域 22 个任务×agent 对的 5 pp)医疗健康 · 视觉与空间感知: 1 个失败运行(占该领域 22 个任务×agent 对的 5 pp)医疗健康 · 领域专家判断: 1 个失败运行(占该领域 22 个任务×agent 对的 5 pp)医疗健康 · 端到端驱动专业工具链: 1 个失败运行(占该领域 22 个任务×agent 对的 5 pp)计算与数学 (20 对 / 12 败)计算与数学 · 实证调参与样本外验证: 1 个失败运行(占该领域 20 个任务×agent 对的 5 pp)计算与数学 · 独立实证核验: 4 个失败运行(占该领域 20 个任务×agent 对的 20 pp)计算与数学 · 规则与定义的字面忠实: 1 个失败运行(占该领域 20 个任务×agent 对的 5 pp)计算与数学 · 预算节奏与运行完成: 2 个失败运行(占该领域 20 个任务×agent 对的 10 pp)计算与数学 · 契约自审: 2 个失败运行(占该领域 20 个任务×agent 对的 10 pp)计算与数学 · 视觉与空间感知: 0 个失败运行(占该领域 20 个任务×agent 对的 0 pp)计算与数学 · 领域专家判断: 2 个失败运行(占该领域 20 个任务×agent 对的 10 pp)计算与数学 · 端到端驱动专业工具链: 0 个失败运行(占该领域 20 个任务×agent 对的 0 pp)商业金融 (16 对 / 8 败)商业金融 · 实证调参与样本外验证: 0 个失败运行(占该领域 16 个任务×agent 对的 0 pp)商业金融 · 独立实证核验: 1 个失败运行(占该领域 16 个任务×agent 对的 6 pp)商业金融 · 规则与定义的字面忠实: 1 个失败运行(占该领域 16 个任务×agent 对的 6 pp)商业金融 · 预算节奏与运行完成: 2 个失败运行(占该领域 16 个任务×agent 对的 12 pp)商业金融 · 契约自审: 1 个失败运行(占该领域 16 个任务×agent 对的 6 pp)商业金融 · 视觉与空间感知: 1 个失败运行(占该领域 16 个任务×agent 对的 6 pp)商业金融 · 领域专家判断: 1 个失败运行(占该领域 16 个任务×agent 对的 6 pp)商业金融 · 端到端驱动专业工具链: 0 个失败运行(占该领域 16 个任务×agent 对的 0 pp)工程 (12 对 / 9 败)工程 · 实证调参与样本外验证: 1 个失败运行(占该领域 12 个任务×agent 对的 8 pp)工程 · 独立实证核验: 1 个失败运行(占该领域 12 个任务×agent 对的 8 pp)工程 · 规则与定义的字面忠实: 0 个失败运行(占该领域 12 个任务×agent 对的 0 pp)工程 · 预算节奏与运行完成: 2 个失败运行(占该领域 12 个任务×agent 对的 17 pp)工程 · 契约自审: 0 个失败运行(占该领域 12 个任务×agent 对的 0 pp)工程 · 视觉与空间感知: 2 个失败运行(占该领域 12 个任务×agent 对的 17 pp)工程 · 领域专家判断: 0 个失败运行(占该领域 12 个任务×agent 对的 0 pp)工程 · 端到端驱动专业工具链: 3 个失败运行(占该领域 12 个任务×agent 对的 25 pp)生命科学 (20 对 / 12 败)生命科学 · 实证调参与样本外验证: 2 个失败运行(占该领域 20 个任务×agent 对的 10 pp)生命科学 · 独立实证核验: 2 个失败运行(占该领域 20 个任务×agent 对的 10 pp)生命科学 · 规则与定义的字面忠实: 2 个失败运行(占该领域 20 个任务×agent 对的 10 pp)生命科学 · 预算节奏与运行完成: 1 个失败运行(占该领域 20 个任务×agent 对的 5 pp)生命科学 · 契约自审: 1 个失败运行(占该领域 20 个任务×agent 对的 5 pp)生命科学 · 视觉与空间感知: 0 个失败运行(占该领域 20 个任务×agent 对的 0 pp)生命科学 · 领域专家判断: 2 个失败运行(占该领域 20 个任务×agent 对的 10 pp)生命科学 · 端到端驱动专业工具链: 1 个失败运行(占该领域 20 个任务×agent 对的 5 pp)物理科学 (14 对 / 8 败)物理科学 · 实证调参与样本外验证: 3 个失败运行(占该领域 14 个任务×agent 对的 21 pp)物理科学 · 独立实证核验: 0 个失败运行(占该领域 14 个任务×agent 对的 0 pp)物理科学 · 规则与定义的字面忠实: 0 个失败运行(占该领域 14 个任务×agent 对的 0 pp)物理科学 · 预算节奏与运行完成: 0 个失败运行(占该领域 14 个任务×agent 对的 0 pp)物理科学 · 契约自审: 1 个失败运行(占该领域 14 个任务×agent 对的 7 pp)物理科学 · 视觉与空间感知: 1 个失败运行(占该领域 14 个任务×agent 对的 7 pp)物理科学 · 领域专家判断: 1 个失败运行(占该领域 14 个任务×agent 对的 7 pp)物理科学 · 端到端驱动专业工具链: 0 个失败运行(占该领域 14 个任务×agent 对的 0 pp)教育信息 (3 对 / 3 败)教育信息 · 实证调参与样本外验证: 0 个失败运行(占该领域 3 个任务×agent 对的 0 pp)教育信息 · 独立实证核验: 0 个失败运行(占该领域 3 个任务×agent 对的 0 pp)教育信息 · 规则与定义的字面忠实: 1 个失败运行(占该领域 3 个任务×agent 对的 33 pp)教育信息 · 预算节奏与运行完成: 0 个失败运行(占该领域 3 个任务×agent 对的 0 pp)教育信息 · 契约自审: 1 个失败运行(占该领域 3 个任务×agent 对的 33 pp)教育信息 · 视觉与空间感知: 1 个失败运行(占该领域 3 个任务×agent 对的 33 pp)教育信息 · 领域专家判断: 0 个失败运行(占该领域 3 个任务×agent 对的 0 pp)教育信息 · 端到端驱动专业工具链: 0 个失败运行(占该领域 3 个任务×agent 对的 0 pp)心理神经 (5 对 / 4 败)心理神经 · 实证调参与样本外验证: 0 个失败运行(占该领域 5 个任务×agent 对的 0 pp)心理神经 · 独立实证核验: 1 个失败运行(占该领域 5 个任务×agent 对的 20 pp)心理神经 · 规则与定义的字面忠实: 1 个失败运行(占该领域 5 个任务×agent 对的 20 pp)心理神经 · 预算节奏与运行完成: 1 个失败运行(占该领域 5 个任务×agent 对的 20 pp)心理神经 · 契约自审: 0 个失败运行(占该领域 5 个任务×agent 对的 0 pp)心理神经 · 视觉与空间感知: 1 个失败运行(占该领域 5 个任务×agent 对的 20 pp)心理神经 · 领域专家判断: 0 个失败运行(占该领域 5 个任务×agent 对的 0 pp)心理神经 · 端到端驱动专业工具链: 0 个失败运行(占该领域 5 个任务×agent 对的 0 pp)交通安全 (3 对 / 1 败)交通安全 · 实证调参与样本外验证: 0 个失败运行(占该领域 3 个任务×agent 对的 0 pp)交通安全 · 独立实证核验: 1 个失败运行(占该领域 3 个任务×agent 对的 33 pp)交通安全 · 规则与定义的字面忠实: 0 个失败运行(占该领域 3 个任务×agent 对的 0 pp)交通安全 · 预算节奏与运行完成: 0 个失败运行(占该领域 3 个任务×agent 对的 0 pp)交通安全 · 契约自审: 0 个失败运行(占该领域 3 个任务×agent 对的 0 pp)交通安全 · 视觉与空间感知: 0 个失败运行(占该领域 3 个任务×agent 对的 0 pp)交通安全 · 领域专家判断: 0 个失败运行(占该领域 3 个任务×agent 对的 0 pp)交通安全 · 端到端驱动专业工具链: 0 个失败运行(占该领域 3 个任务×agent 对的 0 pp)法律 (2 对 / 1 败)法律 · 实证调参与样本外验证: 0 个失败运行(占该领域 2 个任务×agent 对的 0 pp)法律 · 独立实证核验: 0 个失败运行(占该领域 2 个任务×agent 对的 0 pp)法律 · 规则与定义的字面忠实: 0 个失败运行(占该领域 2 个任务×agent 对的 0 pp)法律 · 预算节奏与运行完成: 0 个失败运行(占该领域 2 个任务×agent 对的 0 pp)法律 · 契约自审: 1 个失败运行(占该领域 2 个任务×agent 对的 50 pp)法律 · 视觉与空间感知: 0 个失败运行(占该领域 2 个任务×agent 对的 0 pp)法律 · 领域专家判断: 0 个失败运行(占该领域 2 个任务×agent 对的 0 pp)法律 · 端到端驱动专业工具链: 0 个失败运行(占该领域 2 个任务×agent 对的 0 pp)社会科学 (1 对 / 0 败)社会科学 · 实证调参与样本外验证: 0 个失败运行(占该领域 1 个任务×agent 对的 0 pp)社会科学 · 独立实证核验: 0 个失败运行(占该领域 1 个任务×agent 对的 0 pp)社会科学 · 规则与定义的字面忠实: 0 个失败运行(占该领域 1 个任务×agent 对的 0 pp)社会科学 · 预算节奏与运行完成: 0 个失败运行(占该领域 1 个任务×agent 对的 0 pp)社会科学 · 契约自审: 0 个失败运行(占该领域 1 个任务×agent 对的 0 pp)社会科学 · 视觉与空间感知: 0 个失败运行(占该领域 1 个任务×agent 对的 0 pp)社会科学 · 领域专家判断: 0 个失败运行(占该领域 1 个任务×agent 对的 0 pp)社会科学 · 端到端驱动专业工具链: 0 个失败运行(占该领域 1 个任务×agent 对的 0 pp)
图 13 领域(行,括号为任务×agent 对数 / 失败数)× 缺失能力主题(列,按总数排序)的失败运行数。黑框为该领域数量最多的三个主题。

横向:改进哪三项能力整体收益最大。按失败运行数排序的前三个主题及其领域分解:

能力主题(agent 侧,横向 top 3)所属改进方向对应任务侧维度该主题失败运行的任务侧条件失败运行数占全部失败全部翻转的上限按领域分解(数量与占该领域对数的 pp)
实证调参与样本外验证实证调参与验证EV · PR · QLqEV 均值 3.42(其他失败 1.56)1217%+10 pp医疗健康 5(23 pp) · 物理科学 3(21 pp) · 生命科学 2(10 pp) · 计算与数学 1(5 pp) · 工程 1(8 pp)
独立实证核验过程纪律VB · MCuVB 均值 3.80(其他失败 3.65)1014%+8 pp计算与数学 4(20 pp) · 生命科学 2(10 pp) · 工程 1(8 pp) · 商业金融 1(6 pp) · 交通安全 1(33 pp) · 心理神经 1(20 pp)
规则与定义的字面忠实过程纪律CS · MCrCS 均值 3.80(其他失败 3.70)1014%+8 pp医疗健康 4(18 pp) · 生命科学 2(10 pp) · 商业金融 1(6 pp) · 计算与数学 1(5 pp) · 心理神经 1(20 pp) · 教育信息 1(33 pp)

三者合计 32 个失败运行,占全部失败的 44%,全部翻转的上限是通过率 +27 pp(当前 39%)。三者都是领域通用技能,在几乎每个有足够样本的领域里都出现,所以横向改进的收益是分散在各领域的,而不是集中在某一个。

纵向:每个领域改进什么收益最大。失败运行不少于 3 个的领域,各自前三个主题(括号为占该领域对数的百分点):

领域(纵向)第一第二第三
医疗健康(22 对 / 14 败,通过 36%)实证调参与样本外验证 5(23 pp)规则与定义的字面忠实 4(18 pp)契约自审 1(5 pp)
计算与数学(20 对 / 12 败,通过 40%)独立实证核验 4(20 pp)预算节奏与运行完成 2(10 pp)契约自审 2(10 pp)
商业金融(16 对 / 8 败,通过 50%)预算节奏与运行完成 2(12 pp)独立实证核验 1(6 pp)规则与定义的字面忠实 1(6 pp)
工程(12 对 / 9 败,通过 25%)端到端驱动专业工具链 3(25 pp)预算节奏与运行完成 2(17 pp)视觉与空间感知 2(17 pp)
生命科学(20 对 / 12 败,通过 40%)实证调参与样本外验证 2(10 pp)独立实证核验 2(10 pp)规则与定义的字面忠实 2(10 pp)
物理科学(14 对 / 8 败,通过 43%)实证调参与样本外验证 3(21 pp)契约自审 1(7 pp)视觉与空间感知 1(7 pp)
教育信息(3 对 / 3 败,通过 0%)规则与定义的字面忠实 1(33 pp)契约自审 1(33 pp)视觉与空间感知 1(33 pp)
心理神经(5 对 / 4 败,通过 20%)独立实证核验 1(20 pp)规则与定义的字面忠实 1(20 pp)预算节奏与运行完成 1(20 pp)

读法上有两点。第一,医疗健康、物理科学、生命科学的第一项都是实证调参与样本外验证,这些领域的任务多以隐藏精度阈值计分,方法严谨性直接决定分数;计算与数学的第一项是独立实证核验,这里的任务多有可自行构造的检查(写暴力解、测试生成器)却没有做;工程的前三里出现了端到端驱动专业工具链和视觉空间感知,是唯一领域专属能力占比高的领域;商业金融和心理神经的失败更分散,预算节奏和规则忠实各占一角。第二,样本量:小领域每格只有一两个运行,只能提示方向;大领域(医疗、计算与数学、生命科学)的排序可以当作可靠的优先级。

5可信度与局限 #

确定性高的结论:ALE 考什么不考什么(计数);难度分层与需求标注一致(n = 139,多维 p < 0.001);两个 agent 的失败随整体需求单调上升(两种标签、控制 tier 后仍成立);需求画像对成败的样本外预测力弱;交付层失误占失败的约三成且工作已完成;四个新维度中 VB 提供独立于原体系的信息、BP 有阈值效应并能分出预算耗尽类失败。

不应下的结论:维度特异的能力短板(共线,偏相关归零);两个 agent 之间的差异(gpt-5.5 只有 37 个任务,区间重叠,标签有偏);SC、TU、QLq"无影响"(等级无方差);MS、KNs、VI、SNs、KNn 的能力值(高等级样本不足);CS 的区分度(等级挤在 4 级);PR 与某一类失败的专属关系。

其他局限:单一判分模型、单次采样;两个任务的需求判分和四个运行的轨迹审计由 Sonnet 5 完成;轨迹审计的归因置信度仍以中为主(高 8、中 43、低 21),审计读的是压缩轨迹(长输出截断、长运行抽样保留),与自述版归因的一致率 69%;“缺失能力”主题的归纳由判分模型一次完成,未做人工复核。

参考文献 #

ADeLe:Zhou, L., Pacchiardi, L., Martínez-Plumed, F. et al. General scales unlock AI evaluation with explanatory and predictive power. Nature 652, 58–67 (2026). https://doi.org/10.1038/s41586-026-10303-2;工具包 Kinds-of-Intelligence-CFI/ADeLe-AIEvaluation。ALE:Sun, Y., Han, X., Zhang, W. et al. Agents' Last Exam. arXiv:2606.05405 (2026)。

能力边界,需要被逐维度地量出来

如果你也在用需求画像和轨迹审计的方法度量 agent 的能力边界,或者想把这套方法用到自己的业务任务上,我们很乐意交换思路。

预约交流

继续阅读 / More reading

AI 能力边界 · 2026-04-27

ABC 模型:AI 能力边界的三层分化

阅读
开放问题 · 2026-06-08

可编程劳动力的三个开放问题

阅读