摘要 #
- ALE 考什么。几乎每个任务在相关信息识别、批判性思维、校准、逻辑推理、工作量、规格合规上都是 3 到 4 级;心智建模、社科知识、语言表达基本不考;视觉/GUI、空间推理、自然科学只在约一半任务出现。
- 难度分层有认知基础。ALE 作者把任务分成 near-term、full-spectrum、last-exam 三个由易到难的层;把这三层记作 0、1、2(下文的 tier 秩),综合需求因子与它的 Spearman ρ = 0.47(p < 0.0001)。最对齐的维度是规划长程(0.43)、相关信息识别、校准、工作量、工具操作,而不是知识广度。补充的 PL、TU 两维进入前五。
- agent 的失败随任务的整体需求上升,而不是随某个维度。任务在核心六维(PL、AS、CL、MCu、MCr、VO)上的等级高度同步(两两相关 0.4 到 0.7):把各维等级标准化后取平均得到一个“整体需求”因子,它与通过率显著相关;扣除这个因子的影响之后,每一维与通过率的剩余相关都接近 0。数据支持“任务越重 agent 越容易失败”,不支持“agent 在某一维特别弱”,能力雷达图上各维度之间的形状差异因此不可解读,只有总体大小有意义。
- 结果侧用两个视角看同一批失败:agent 自己的叙述,和第三方对完整轨迹的审计。前者是 agent 认为自己做了什么、达到了什么;后者由判分模型逐步核对 154 个运行的 shell 命令与返回、文件读写、GUI 动作(带步骤号)。两个视角对失败主因的一致率 69%,分歧本身是信息:两个 agent 的 72 个失败里,61% 是流程走完但方法或精度不达标;36% 以一句轨迹不支持的“已完成 / 已验证”结束(opus-4.8 23/51,gpt-5.5 3/21),最终断言无据的运行通过率为 0,有据的为 51%;在有可核验抓手的 51 个失败里 21 个没有用这些抓手。
- 缺的能力多数是领域通用技能,不是领域知识。对 67 个失败运行逐一回答“若改进哪项能力最可能翻转这次运行”,归成 8 个主题后,55 个是领域通用技能(实证调参与样本外验证、独立实证核验、规则与定义的字面忠实、契约自审、预算节奏、视觉空间感知),只有 12 个是领域专属知识或专业工具链。这与需求侧一致:知识类维度与分层和成败都不相关,相关的都是规划、校准、信息处理这类过程性维度。领域通用技能跨领域迁移,改进一次抬高多个领域;领域知识只能逐领域补。EV(实证验证需求)就是为最大的那个主题定义的任务侧维度,过程纪律则要在 agent 侧度量。
- 每个维度在需求侧和结果侧的结论并排见 3.8 节的总表和图 12。11 个维度与成败显著相关,控制综合因子后仍有信号的只有 1 个;能分出具体失败类型的维度都来自结果侧驱动的那一批。
- 三个改进方向按投入产出比排序,其中最便宜的一项常被低估。过程纪律:26 个失败以无据断言结束、21 个没有用任务提供的抓手,这些运行的工作已经完成,缺的只是核验和如实报告,修复它不需要新能力,上限 +14 pp(opus-4.8)。预算节奏:opus-4.8 独有的 7 个失败几乎全是 0 分,修法是先交一份合法的部分产出。实证调参与样本外验证:44 个失败流程走完但精度不达标,上限 +33 到 +46 pp,是最大的池子,且是领域通用、可训练的。4.5 节按能力和按领域两个维度给出分解。
背景与目的 #
Agent 已经能够执行相当多样的专业工作:写代码和修复缺陷、操作办公软件和桌面应用、跑科学计算和数据分析流水线、做金融和法律文书。与之相应,面向专业场景、经济价值高的任务类型的基准也越来越多,覆盖软件工程、计算机使用、科研复现、金融法律等方向。这些基准的作用是给出不同模型在某个垂直场景或某类能力上的绝对水平和相对排名,这对选型和进度跟踪已经足够。
但对改进 agent 来说还不够。我们还希望知道更细粒度的能力维度上 agent 的表现:一个 60% 的通过率里,失败的 40% 是因为规划不够长、领域知识不够深、还是交付前没有核验?只有回答了这个问题,才能有针对性地优化表现不佳的能力维度,并预期它能把相应基准的指标抬高多少。当前多数基准只报告一个分数,agent 在其上的表现缺乏直观的、定量的分析,也没有给出明确的能力改进方向。
因此本文选择一个领域和场景覆盖相对广、任务有挑战性的数据集做深入分析:Agents' Last Exam 的 139 个公开任务横跨 12 个领域、49 个子领域,任务是真实的专业工作,前沿 agent 的通过率不到一半。分析框架用 ADeLe(Zhou et al., Nature 2026):它把每个任务标注成若干认知需求维度上的等级,把"任务要求什么"和"agent 做得到什么"分开度量,天然适合回答细粒度能力的问题。在此基础上做了两处扩展:一是按 agent 任务的特点补充了原框架没有的维度;二是在需求侧的相关分析之外,增加了对每个失败运行的结果侧归因,并把两条证据链交叉印证。最终产出是几个有统计支持、有代表性案例、能估计收益上限的改进方向。
1ALE 任务的背景与情况 #
1.1ALE 是什么
Agents' Last Exam(ALE)由 UC Berkeley RDI 主导,目标是用经济上有价值、结果可验证的长程真实工作评测前沿 agent 系统。任务按 O*NET / SOC 职业分类组织成 13 个行业簇、55 个子领域,由行业专家提供并验证。公开仓库带约 150 个任务和 ale_run 框架:一次实验是"一个 agent harness × 一个环境 × 一个任务",框架负责开沙箱、注入输入、让 agent 自主跑到结束、再注入隐藏参考并评分。
与问答式基准的关键差别有三点。第一,评测对象是完整的 harness(Claude Code、Codex、Openclaw 等),不是被逐步操控的模型;ALE 只给任务描述,把终端和桌面 GUI 一并交给 agent。第二,环境是装有真实专业软件的 Windows 或 Ubuntu 虚拟机,任务数据是真实文件。第三,评分看留在 output/ 里的产物,用隐藏参考做确定性比对,分数在 [0, 1]。
1.2任务包与评分
一个任务是 tasks/<domain>/<task>/main.py 加 task_card.json。main.py 有三个钩子:load() 声明任务和变体(含给 agent 的任务描述),start() 在沙箱里准备工作区,evaluate() 在 agent 结束后读取产物和参考并返回分数。数据在 ale-tasks-data/<domain>/<task>/<variant>/ 下分三类:input/ 对 agent 可见,software/ 是启动器和运行时,reference/ 是隐藏参考,只在评分阶段注入。
评分器有两个反复出现的特征,后面的分析会不断回到它们。一是硬门槛:文件缺失、多出文件、schema 或表头不对、编码不对,整份或整个子任务直接 0 分。二是分层部分得分:很多任务分 Tier 1/2/3 或按子任务给分,所以 [0, 1] 之间的分数很常见,全部 157 条结果里 65 条是部分得分。本文沿用 ALE 自己的规则,把 score == 1.0 记为通过,另做一个保留部分得分的软标签版本。
1.3本文覆盖的任务集
ALE 公开的任务数据有 144 个变体,去掉 5 个 demo 后 139 个进入分析,每个变体是 ADeLe 意义上的一个实例。ALE 的 selected_tasks/full/ 把任务分成三个难度层:near-term 60 个、full-spectrum 46 个、last-exam 32 个(1 个未分层)。操作系统 Ubuntu 105 个、Windows 34 个;6 个任务需要 GPU;单任务墙钟预算中位数 2 小时、最长 8 小时。输入体量差异极大:文件数中位数 6、最多 41,771,大小中位数 1.2 MB、最大 13 GB。软件以 Python 数据栈为主(Python 93 个任务、pandas 28、NumPy 25、PyTorch 8、R 7),专业软件覆盖 KiCad、Blender、MicroDicom、matRad、OpenROAD、Amber、PLAXIS、Ghidra 等。
1.4已有的运行结果
能力分析用的是 ALE 公开运行轨迹(ale-traces)里的两类记录:151 个任务各一条"最佳运行"(walkthrough)和 13 个任务的 Codex 与 Claude Code 对照运行。ALE leaderboard 不提供完整的 agent × task 矩阵。按轨迹数取前两个 agent:claude-code / opus-4.8 覆盖 81 个任务、通过 30 个(37%,平均分 0.61);codex / gpt-5.5 覆盖 37 个、通过 16 个(43%,平均分 0.70)。
标签的选择偏差必须先说明。walkthrough 只保留每个任务表现最好的那次运行,某个 agent 出现在某个任务上,往往意味着它在那个任务上赢了别的 agent。因此两个 agent 的任务子集都不是随机的,通过率偏高,两者之间的差异不可直接比较。本文所有能力数字都在这个前提下解读。
2ALE 任务的 ADeLe 分析 #
2.1方法
ADeLe 的核心不变量是需求描述任务,不描述作答:每个 rubric 定义 0 到 5 级,由 LLM judge 阅读任务实例后给出一个整数等级,与任何模型的表现无关。把 ALE 接进这套流程需要解决"任务实例是什么":ALE 的任务描述大多是"读 problem_spec.md",需求量藏在输入文档里。本文给 judge 的实例文本由 task_card.json 的标题、摘要、给 agent 的指令、必做事项和软件环境组成,再拼上 input/ 目录清单和顶层规格文档(截断到 16k 字符),不含隐藏参考,也不含 task_card 的 inputFiles 描述字段。实例文本中位数约 1.4k token。
判分模型是 claude-opus-5,以无工具、最小系统提示的方式逐对调用,139 × 22 = 3132 次,全部解析有效,单次中位 82 秒。两个药物化学 SMILES 抽取任务(37 对)被 Opus 5 的安全过滤确定性拦截,改由 claude-sonnet-5 判分。ADeLe 的不可猜测性维度 UG 由作答形式决定,ALE 全是开放式产物任务,统一取 100。
2.2补充维度:4 个 agentic + 5 个结果侧驱动
ADeLe v1 的 18 个维度为问答任务设计,没有覆盖 agent 任务特有的需求。本文补了 9 个任务侧维度,分两组,格式与原 rubric 一致(0 到 5 级各配三个示例,通过 ADeLe 的 rubric 校验),本章所有图表按三组着色:
agentic 补充(4 个):按 ALE 任务的形态补上工具操作、长程规划、视觉与 GUI、规格合规四类需求。
命令行、运行时、包管理、专业软件(CAD/EDA/DICOM/MD 流水线)的安装、配置、串联与排障;不含解释结果所需的领域知识。
把目标拆成相互依赖的阶段、自行选择路线、检查中间产物并调整、在没有外部反馈的长时间运行中跟踪进度和恢复失败。
读图、读屏、判读图纸和医学影像,以及在图形界面里定位控件、点击、拖拽、从画布推断状态。
精确的输出契约(文件名、schema、编码、容差、硬门槛)以及在无反馈条件下自行核验产物是否满足契约的要求。
结果侧驱动补充(5 个):动机来自第 3 章的失败归因,它显示相当一部分失败落在原有画像之外(做完了但精度不达标、做完了但没核验、契约写错、预算耗尽),为了让这些失败能指向体系内的维度,又不违反“维度描述任务而不描述作答”的不变量,把它们各自对应的任务侧属性写成 rubric;EV 来自 3.7 节对缺失能力主题的归纳。这批维度的标注在实例文本后附上评分规则,因为通过标准是任务需求的一部分,即便 agent 看不到它。
有多少精确条件必须同时成立、是否有一票否决的硬门槛、是否惩罚多余内容。对应契约违规和漏读规格。
隐藏参考的容差相对“胜任但非专家的标准方法”能达到的水平有多紧。对应领域方法 / 精度不达标。
任务给了多少可核验的抓手(可见参考值、测试、可校验的中间结果),通过标准藏得多深。对应未验证即宣称完成。
计算与等待、条目规模相对固定会话预算的紧张程度,能否分段交付。对应规划 / 预算耗尽。
达标需要多少轮实证迭代:选模型、调参、收敛、用留出集 / 回测 / 收敛性研究判断何时达标。对应实证调参与样本外验证。
2.3各维度的等级分布
等级的含义。每个维度的 rubric 把需求分成 0 到 5 级:0 级是这个维度完全用不上,5 级是一个完全胜任的人也要动用该维度最高水平的能力。等级描述的是任务对“一个有充分知识、工具和技能的人”的要求,与哪个 agent 来做无关。各维度的 5 级各有具体定义:工作量 VO 按人完成任务的时间分档(1 级 1 分钟以内,3 级 10 到 100 分钟,5 级超过 16 小时);知识类维度按所需教育程度分档(1 级常识,3 级本科,5 级研究前沿);推理和元认知类维度按推理链的长度和不确定性分档。等级是序数不是等距:从 3 级到 4 级和从 1 级到 2 级不是“同样多”的增量。
怎么读图 3。一行一个维度,横条按 0 到 5 级任务的占比切段,颜色越深等级越高,右端是均值。一行几乎全是深色说明这个维度是 ALE 普遍的高要求;一行以最浅的 0 级为主说明 ALE 几乎不考它;一行从浅到深都有说明这个维度能把任务区分开,这种维度在后面的成败分析里才有用。左侧色块是维度分组,横线分隔三组。
139 个任务在 27 个维度上的分布里,原维度三类一目了然。高而均匀的一类:MCr、MCt、MCu、QLl、VO、SC、AS、CEc、AT、KNf 有 78% 以上的任务落在 3 到 4 级,VO 没有任何任务低于 3 级。几乎不考的一类:MS 有 76% 的任务为 0 级,KNs 70%,CEe 几乎全在 1 级。两极分化的一类:VI、SNs、KNn 各有约一半任务为 0 级,另一半集中在 3 到 4 级,对应有无影像、几何或自然科学内容的任务子集。补充维度里,PL、TU、PR、BP、EV 的分布展开了(EV 标准差 1.13,BP 和 PR 0.93),VI 两极分化,SC 和 CS 像原维度一样挤在 3 到 4 级。
2.4需求与难度分层
ALE 的作者把任务分成三个难度层:near-term 是预期近期就能被 agent 解决的任务,full-spectrum 是中间的主体,last-exam 是预期最后才会被攻克的任务。这个划分是作者的主观判断,需求标注给出了独立的检验。做法是把三层按由易到难记作 0、1、2,称为 tier 秩,然后计算每个维度的等级与 tier 秩的 Spearman 秩相关:ρ 为正表示作者认为越难的任务在这个维度上的需求也越高,ρ 接近 0 表示这个维度与作者的难度判断无关。22 个原维度的标准化均值(综合需求因子)与 tier 秩的 ρ = 0.47,p < 0.0001。逐维看,与分层最对齐的是 PL(0.43)、MCr(0.34)、VO(0.32)、MCu(0.32)、TU(0.30)、CL(0.29),全部 p < 0.01;知识类维度 KNf、KNn、KNs、KNc 和 CEe、MS 与分层无关。也就是说,ALE 作者心目中的"难"是规划跨度、信息筛选、校准和工作量,不是知识广度。补充的 PL 是与 tier 最对齐的单一维度,TU 排第五,说明它们捕捉到了 18 个原维度没覆盖的东西;不过 PL 与核心维度的相关在 0.4 到 0.7 之间,并非完全独立。结果侧驱动的五个里,BP(+0.32)、PR(+0.23)、EV(+0.23)与分层显著相关,CS 和 VB 不相关:契约的严格和抓手的多少不随难度层变化。
| 维度 | 组 | near-term (n=60) | full-spectrum (n=46) | last-exam (n=32) | ρ vs tier | p |
|---|---|---|---|---|---|---|
| PL 规划与长程执行 | agentic 补充 | 2.78 | 3.02 | 3.62 | +0.43 | <0.001 |
| MCr 相关信息识别 | ADeLe v1 原维度 | 3.32 | 3.52 | 3.81 | +0.34 | <0.001 |
| VO 工作量 | ADeLe v1 原维度 | 3.53 | 3.63 | 4.12 | +0.32 | <0.001 |
| BP 预算压力 | 结果侧驱动补充 | 1.55 | 1.50 | 2.62 | +0.32 | <0.001 |
| MCu 已知未知校准 | ADeLe v1 原维度 | 3.22 | 3.22 | 3.72 | +0.32 | <0.001 |
| TU 工具与软件操作 | agentic 补充 | 2.55 | 2.78 | 3.34 | +0.30 | <0.001 |
| CL 概念化与抽象 | ADeLe v1 原维度 | 2.37 | 2.43 | 3.03 | +0.29 | <0.001 |
| MCt 批判性思维 | ADeLe v1 原维度 | 3.38 | 3.43 | 3.84 | +0.28 | <0.001 |
| SNs 空间物理推理 | ADeLe v1 原维度 | 0.95 | 1.37 | 2.16 | +0.28 | <0.001 |
| KNa 应用科学知识 | ADeLe v1 原维度 | 2.98 | 3.37 | 3.84 | +0.26 | 0.002 |
| AS 注意与扫描 | ADeLe v1 原维度 | 3.05 | 3.17 | 3.44 | +0.26 | 0.002 |
| AT 非典型性 | ADeLe v1 原维度 | 3.03 | 3.22 | 3.34 | +0.24 | 0.005 |
| EV 实证验证需求 | 结果侧驱动补充 | 1.47 | 1.52 | 2.22 | +0.23 | 0.006 |
| SC 规格合规与自检 | agentic 补充 | 3.32 | 3.59 | 3.66 | +0.23 | 0.006 |
| PR 精度要求 | 结果侧驱动补充 | 2.95 | 3.22 | 3.53 | +0.23 | 0.007 |
| QLl 逻辑推理 | ADeLe v1 原维度 | 3.35 | 3.37 | 3.75 | +0.22 | 0.011 |
| QLq 定量推理 | ADeLe v1 原维度 | 2.82 | 2.87 | 3.47 | +0.19 | 0.022 |
| VI 视觉感知与 GUI | agentic 补充 | 0.92 | 1.02 | 1.41 | +0.16 | 0.065 |
| CEc 语言理解 | ADeLe v1 原维度 | 3.12 | 3.20 | 3.38 | +0.16 | 0.068 |
| KNf 形式科学知识 | ADeLe v1 原维度 | 3.45 | 3.48 | 3.81 | +0.13 | 0.128 |
| KNc 日常常识 | ADeLe v1 原维度 | 1.47 | 1.61 | 1.59 | +0.11 | 0.194 |
| KNs 社科人文知识 | ADeLe v1 原维度 | 0.48 | 0.87 | 0.78 | +0.11 | 0.198 |
| MS 心智建模 | ADeLe v1 原维度 | 0.28 | 0.30 | 0.41 | +0.08 | 0.341 |
| CEe 语言表达 | ADeLe v1 原维度 | 1.33 | 1.43 | 1.44 | +0.05 | 0.527 |
| KNn 自然科学知识 | ADeLe v1 原维度 | 1.90 | 1.70 | 2.12 | +0.04 | 0.658 |
| CS 输出契约严格度 | 结果侧驱动补充 | 3.65 | 3.76 | 3.69 | +0.04 | 0.661 |
| VB 自检负担 | 结果侧驱动补充 | 3.60 | 3.54 | 3.56 | -0.04 | 0.652 |
2.5领域特征
需求画像按领域分开看才能回答“优化什么能力对哪些领域收益大”的第一半:每个领域在哪些维度上要求更高。图 5 是领域 × 维度的热力图,颜色越深平均等级越高,每行加黑边框的三格是该领域相对全体均值高出最多的维度;悬停可见数值和与全体均值的差。读法:横向看一行,是这个领域的需求指纹;纵向看一列,是这个维度在哪些领域被要求得最多。收益的另一半(改进哪项能力能翻转哪些领域的失败)在 4.5 节。
知识类维度的领域指纹最清楚:应用科学知识 KNa 在医疗、工程、生命科学接近 4 级,在计算与数学只有 1 级;自然科学知识 KNn 集中在物理科学(4.3)和生命科学(3.5),商业金融和法律为 0;形式科学知识 KNf 在计算与数学最高(4.0);空间推理 SNs 和视觉 VI 集中在工程;社科知识 KNs 只在商业金融、法律、教育出现。过程性维度的领域差异小得多:工具操作 TU、规划 PL、预算压力 BP 在工程最高,实证验证需求 EV 在物理科学和医疗最高。各领域最突出的三个维度:医疗健康 KNa, KNn, QLq;计算与数学 KNf, QLl, CL;商业金融 KNs, KNc, MS;工程 SNs, VI, TU;生命科学 KNn, KNa, TU;物理科学 KNn, SNs, QLq。
展开:领域 × 维度均值表
| 领域 (n) | KNa | KNf | KNn | KNs | QLq | SNs | TU | VI | PL | VO |
|---|---|---|---|---|---|---|---|---|---|---|
| 医疗健康 (26) | 4.2 | 3.8 | 2.6 | 0.4 | 3.4 | 1.0 | 2.7 | 0.8 | 3.1 | 3.9 |
| 计算与数学 (23) | 1.1 | 4.0 | 0.5 | 0.1 | 3.0 | 0.7 | 2.6 | 0.6 | 3.0 | 3.6 |
| 商业金融 (21) | 3.6 | 3.0 | 0.0 | 2.5 | 2.5 | 0.6 | 2.3 | 1.1 | 3.0 | 3.7 |
| 工程 (20) | 4.0 | 3.5 | 2.0 | 0.1 | 3.1 | 3.1 | 3.5 | 2.2 | 3.5 | 3.8 |
| 生命科学 (19) | 4.0 | 3.6 | 3.5 | 0.0 | 2.6 | 0.9 | 3.1 | 0.7 | 2.7 | 3.4 |
| 物理科学 (15) | 3.3 | 3.5 | 4.3 | 0.0 | 3.5 | 2.5 | 3.0 | 1.0 | 3.2 | 3.9 |
| 教育信息 (4) | 2.8 | 3.0 | 0.2 | 2.5 | 2.5 | 0.8 | 2.2 | 0.8 | 2.5 | 3.5 |
| 心理神经 (3) | 3.0 | 3.0 | 1.0 | 1.3 | 2.3 | 2.3 | 2.7 | 3.0 | 3.0 | 4.0 |
| 交通安全 (3) | 4.0 | 4.0 | 1.7 | 0.3 | 3.7 | 2.0 | 2.3 | 0.0 | 3.3 | 3.7 |
| 法律 (2) | 4.0 | 2.5 | 0.0 | 3.0 | 2.0 | 0.0 | 2.0 | 0.5 | 2.5 | 3.5 |
| 其他 (2) | 2.0 | 2.0 | 0.0 | 0.5 | 2.0 | 3.5 | 2.0 | 4.0 | 3.0 | 3.0 |
| 社会科学 (1) | 3.0 | 4.0 | 1.0 | 4.0 | 4.0 | 0.0 | 4.0 | 1.0 | 4.0 | 4.0 |
2.6标注质量与局限
两个问题会直接影响第 3 节的解读。第一,方差压缩:AS、AT、CEc、MCr、MCt、MCu、SC 等维度九成以上任务挤在 3 到 4 级,5 级极少。这可能是 rubric 顶层示例对 agentic 任务分辨率不够,也可能是判分模型偏保守;无论哪种,它意味着这些维度在任务之间几乎没有区分度,后面"与通过率无关"的结论要先排除这个原因。第二,单次判分、无重复:每对只采样一次,判分噪声未估计。对同一批 prompt 重复采样取中位数不需要新输入,但只能压掉噪声,压不掉系统性天花板。
2.7结果侧驱动维度的分布与冗余度
结果侧驱动的五个维度需要单独回答一个问题:它们是不是原 22 维已经有的信息。下表给出每个维度的等级分布、与难度分层的相关、与原 22 维综合因子的相关,以及相关最高的原维度(139 个任务齐全)。
| 维度 | L1 | L2 | L3 | L4 | L5 | 均值 | 标准差 | ρ vs tier | ρ vs 原 22 维综合因子 | 与原维度的最高相关 |
|---|---|---|---|---|---|---|---|---|---|---|
| CS 输出契约严格度 | 0 | 9 | 31 | 92 | 7 | 3.70 | 0.67 | +0.04 | +0.24 | CEc +0.40, SC +0.35, KNs +0.28 |
| PR 精度要求 | 5 | 23 | 65 | 35 | 11 | 3.17 | 0.92 | +0.23 * | +0.39 | CL +0.40, MCr +0.35, VO +0.35 |
| VB 自检负担 | 1 | 17 | 29 | 85 | 7 | 3.58 | 0.80 | -0.04 | +0.12 | MCu +0.22, KNa +0.16, MCr +0.15 |
| BP 预算压力 | 67 | 45 | 18 | 8 | 1 | 1.78 | 0.93 | +0.32 * | +0.58 | PL +0.68, VO +0.61, TU +0.54 |
| EV 实证验证需求 | 58 | 34 | 20 | 10 | 1 | 1.66 | 1.13 | +0.23 * | +0.53 | QLq +0.62, CL +0.59, PL +0.59 |
三点观察。PR 和 BP 的等级分布展开了(标准差 0.93),没有原维度那种 3 到 4 级的挤压;CS 仍然挤在 4 级,说明契约严格是 ALE 的普遍属性而不是区分因素。VB 与原 22 维几乎独立(与任一维度的相关不超过 0.22,与综合因子 +0.12),是原体系里没有的信息;BP 则与 PL、VO、TU 高度相关(PL +0.68, VO +0.61, TU +0.54),是同一个"长程、大量"因子的运行面。PR 与 CL、QLl、VO 相关约 0.4,部分重叠。第五个维度 EV 的分布最宽(标准差 1.13,从 0 到 4 级都有支撑),与 QLq、CL、PL 相关约 0.6,是“定量、抽象、长程”那一簇的实证面。
3当前模型在 ALE 上的能力 #
3.1为什么需要两个视角
需求侧是 ADeLe 的标准路径:把每个任务的需求画像和 agent 的通过与否放在一起,问"什么样的任务会失败"。它的长处是可量化、可比较、不依赖任何人对失败过程的解读;短处是相关性分析,维度之间共线时无法归因到单一维度,等级方差被压缩的维度会显得"无关",而标签的选择偏差会同时污染所有维度。
结果侧读每个失败运行的轨迹叙述(agent 的最终报告、分章节小结、评分规则、得分),问"这次为什么失败"。它能看到需求侧看不到的结构:一个 0 分是因为算错了、没做完,还是做完了但文件名写错。短处是它依赖判分模型对 agent 自述的推断,不是评分器的诊断输出,置信度有限,也不能给出"这个 agent 能扛几级"这样的量化边界。
两个视角的盲区互补:需求侧告诉我们失败沿哪个方向单调上升,结果侧告诉我们失败的具体形态;一个结论只有在两边都站得住时才算可靠。
3.2需求侧
通过率随整体需求单调下降。取核心六维(PL、AS、CL、MCu、MCr、VO)的最高等级作任务的"台阶":opus-4.8 在 3 级任务上通过 55%,4 级 28%,5 级 17%;gpt-5.5 是 88%、38%、0%。综合需求因子与通过率的 Spearman 为 -0.34(opus-4.8)和 -0.44(gpt-5.5),都显著。
能力画像。ADeLe 的 ability 是对每个维度拟合"通过概率 ~ 需求等级"的逻辑曲线后在 0 到 5 级上的平均高度;level_50 是曲线跌到 50% 的等级,是最直观的单个数字。针对 N ≈ 100 的情况,本文关闭了工具包默认的"该维度必须是最大需求"过滤(否则每维只剩几个点),只对有 5 个以上样本的等级做重平衡,并对任务做 300 次 bootstrap 给出置信区间;每维附不依赖模型的 Spearman 相关作为交叉检验。软标签版本用 ALE 原始分数替代 0/1,模型在 0/1 标签下与二值版本完全一致。
claude-code / opus-4.8(n = 81):
| 维度 | ability 二值 [95% CI] | level_50 二值 | ρ 二值 | ability 软标签 | level_50 软标签 | ρ 软标签 |
|---|---|---|---|---|---|---|
| PL 规划与长程执行 | 0.47 [0.37, 0.56] | 2.3 | -0.32 * | 0.68 | 3.7 | -0.37 * |
| AS 注意与扫描 | 0.54 [0.40, 0.62] | 2.7 | -0.31 * | 0.66 | 3.4 | -0.38 * |
| CL 概念化与抽象 | 0.41 [0.30, 0.51] | 1.9 | -0.27 * | 0.58 | 3.0 | -0.36 * |
| MCu 已知未知校准 | 0.55 [0.46, 0.64] | 2.8 | -0.32 * | 0.70 | 3.6 | -0.36 * |
| MCr 相关信息识别 | 0.57 [0.42, 0.64] | 2.9 | -0.29 * | 0.73 | 4.0 | -0.30 * |
| VO 工作量 | 0.56 [0.44, 0.66] | 2.9 | -0.30 * | 0.74 | 4.3 | -0.33 * |
| MCt 批判性思维 | 0.51 [0.38, 0.67] | 2.6 | -0.18 | 0.71 | 4.1 | -0.21 |
| QLl 逻辑推理 | 0.51 [0.39, 0.67] | 2.6 | -0.19 | 0.71 | 4.1 | -0.25 * |
| AT 非典型性 | 0.52 [0.36, 0.62] | 2.6 | -0.18 | 0.68 | 3.5 | -0.28 * |
| KNf 形式科学知识 | 0.46 [0.31, 0.60] | 2.1 | -0.14 | 0.65 | 4.1 | -0.14 |
| SC 规格合规与自检 | 0.45 [0.25, 0.58] | 1.9 | -0.03 | 0.69 | 4.5 | -0.12 |
| TU 工具与软件操作 | 0.39 [0.24, 0.49] | 1.3 | -0.18 | 0.62 | 3.9 | -0.15 |
| QLq 定量推理 | 0.37 [0.27, 0.50] | 0.6 | +0.02 | 0.59 | 3.5 | -0.03 |
| KNa 应用科学知识 | 0.37 [0.24, 0.55] | 0.5 | -0.14 | 0.65 | 4.4 | -0.21 |
| VI 视觉感知与 GUI | 0.45 [0.27, 0.59] | 1.6 | +0.10 | 0.61 | 4.1 | +0.02 |
| MS 心智建模 | 0.27 [0.09, 0.43] | 0.0 | -0.05 | 0.48 | 2.3 | -0.05 |
codex / gpt-5.5(n = 37):
| 维度 | ability 二值 [95% CI] | level_50 二值 | ρ 二值 | ability 软标签 | level_50 软标签 | ρ 软标签 |
|---|---|---|---|---|---|---|
| PL 规划与长程执行 | 0.52 [0.36, 0.65] | 2.6 | -0.38 * | 0.71 | 3.8 | -0.48 * |
| AS 注意与扫描 | 0.55 [0.38, 0.65] | 2.8 | -0.34 * | 0.73 | 3.8 | -0.43 * |
| CL 概念化与抽象 | 0.50 [0.39, 0.59] | 2.5 | -0.50 * | 0.66 | 3.4 | -0.57 * |
| MCu 已知未知校准 | 0.61 [0.44, 0.71] | 3.1 | -0.37 * | 0.77 | 4.5 | -0.40 * |
| MCr 相关信息识别 | 0.61 [0.45, 0.71] | 3.1 | -0.35 * | 0.79 | 4.2 | -0.44 * |
| VO 工作量 | 0.70 [0.47, 0.78] | 3.6 | -0.40 * | 0.81 | 4.7 | -0.41 * |
| MCt 批判性思维 | 0.67 [0.51, 0.76] | 3.4 | -0.46 * | 0.82 | 4.4 | -0.50 * |
| QLl 逻辑推理 | 0.55 [0.37, 0.72] | 3.0 | -0.30 | 0.79 | 4.7 | -0.37 * |
| AT 非典型性 | 0.52 [0.36, 0.68] | 2.6 | -0.16 | 0.73 | 3.9 | -0.30 |
| KNf 形式科学知识 | 0.55 [0.38, 0.74] | 3.1 | -0.22 | 0.81 | 5.2 | -0.27 |
| SC 规格合规与自检 | 0.59 [0.39, 0.73] | 3.2 | -0.27 | 0.80 | 4.7 | -0.34 * |
| TU 工具与软件操作 | 0.45 [0.29, 0.62] | 1.9 | -0.01 | 0.72 | 4.0 | -0.28 |
| QLq 定量推理 | 0.52 [0.34, 0.68] | 2.7 | -0.25 | 0.74 | 5.3 | -0.26 |
| KNa 应用科学知识 | 0.60 [0.30, 0.78] | 3.5 | -0.12 | 0.82 | 5.0 | -0.21 |
| VI 视觉感知与 GUI | 0.31 [0.06, 0.51] | 0.0 | -0.12 | 0.53 | 3.0 | -0.21 |
| MS 心智建模 | 0.21 [0.00, 0.47] | 0.0 | -0.18 | 0.55 | 3.2 | -0.10 |
两版结果的维度排序高度一致(Spearman 0.89 和 0.88)。二值标签下 opus-4.8 在核心维度的 level_50 约 2.7 到 2.9 级,软标签下约 3.4 到 4.0 级,可读作:3 级任务大约一半能完全通过,4 级任务多数不能完全通过但常有部分得分。软标签让相关性更清晰,opus-4.8 上显著维度从 6 个增至 8 个,gpt-5.5 上 SC 和 TU 从接近 0 变为可见。

什么是综合因子,“控制它”是什么意思。把每个任务在 22 个原维度上的等级各自标准化后取平均,得到一个数:这个任务总体上有多重。这就是综合因子,下文也叫整体需求。需要它是因为维度之间高度同步:核心六维两两 Spearman 相关 0.38 到 0.70,第一主成分解释 28% 的方差;规划长、信息多、工作量大的任务往往同时也是校准难、抽象难的任务。“控制综合因子后的偏相关”是先把某一维和通过率各自能被综合因子解释的部分扣掉,再看两者剩下的相关:如果它接近 0,这一维对成败的全部影响都可以归结为“任务总体多重”,它本身没有额外信息。下表里核心六维的偏相关全部接近 0。
后果是能力雷达图不能按维度读。每一维的 ability 是分别拟合的,但拟合用的是同一批任务和同一个“总体多重”的信号;既然扣掉这个信号后各维没有剩余信息,维度之间 ability 的高低差别就只是拟合噪声,各维 95% 置信区间宽 0.2 到 0.3 且相互重叠也印证了这一点。雷达图真正可靠的只有它的总体大小,即 agent 对整体需求的耐受度;“这个 agent 在 MCu 上比在 PL 上弱”这种读法没有数据支持。
| 维度 | claude-code / opus-4.8 原始 ρ | 控制 tier | 控制综合因子 | codex / gpt-5.5 原始 ρ | 控制 tier | 控制综合因子 |
|---|---|---|---|---|---|---|
| PL 规划与长程执行 | -0.32 | -0.21 | -0.10 | -0.38 | -0.29 | -0.07 |
| AS 注意与扫描 | -0.31 | -0.26 | -0.16 | -0.34 | -0.28 | -0.09 |
| CL 概念化与抽象 | -0.27 | -0.17 | -0.01 | -0.50 | -0.43 | -0.29 |
| MCu 已知未知校准 | -0.32 | -0.24 | -0.11 | -0.37 | -0.33 | -0.07 |
| MCr 相关信息识别 | -0.29 | -0.18 | -0.08 | -0.35 | -0.31 | -0.03 |
| VO 工作量 | -0.30 | -0.24 | -0.05 | -0.40 | -0.34 | -0.11 |
预测力。用随机森林从 22 维需求预测通过与否(5 折、10 个种子,样本外):
| agent | n | 二值 AUROC 分布内 | 二值 AUROC 跨 tier | 二值 AUROC 跨 domain | 软标签 ρ(pred, score) 分布内 | 软标签 MAE / 均值基线 |
|---|---|---|---|---|---|---|
| claude-code / opus-4.8 | 81 | 0.59 ± 0.05 | 0.43 | 0.57 | 0.18 | 0.375 / 0.389 |
| codex / gpt-5.5 | 37 | 0.54 ± 0.04 | 0.60 | 0.56 | 0.15 | 0.311 / 0.324 |
| pooled top-2 | 118 | 0.56 ± 0.03 | 0.47 | 0.63 | 0.11 | 0.359 / 0.371 |
随机森林在 22 维上的样本外 AUROC 只有 0.54 到 0.63,接近随机;ADeLe 论文在 1.6 万题电池上约 0.88。但这主要是估计方法的问题:N ≈ 80 时 22 个特征的随机森林严重过拟合。把 22 维压成一个综合因子后做逻辑回归,交叉验证 AUROC 为 opus-4.8 0.70、gpt-5.5 0.74、合并 0.70(3.5 节的表)。也就是说,需求画像对成败有中等的预测力,但几乎全部来自一个整体因子,各维度单独不提供样本外增量。软标签版本的预测值与得分的相关 0.11 到 0.23,MAE 只比"预测均值"基线好 0.01 到 0.03。即便按 0.7 的 AUROC 算,仍有相当一部分成败在需求画像之外,这正是结果侧要回答的。
3.3结果侧:从自述到轨迹
结果侧用两个视角看同一批失败。agent 视角只用 ALE 公开的运行叙述:agent 的最终报告、分章节小结,配上评分规则和得分。它回答的是“agent 认为自己做了什么、达到了什么”,是研究 agent 为什么会以为自己完成了的材料,但看不到实际发生的事。第三方视角由判分模型逐步审计 154 个运行的完整轨迹:每条 shell 命令及其返回、文件读写、GUI 动作和 agent 消息,全部带步骤号,要求每个判断引用具体步骤,不采信没有轨迹证据的自述。除失败原因外,第三方视角还记录六项过程事实:输出是否真的写了、agent 做过的最强检查、任务提供了什么可核验抓手、最终断言是否有证据支持、预算是否耗尽、是否知情偏离了明确要求,以及“若改进哪项能力最可能翻转这次运行”。两个视角对失败主因的一致率 69%(67 个失败),分歧集中在“未验证即宣称完成”:第三方视角把其中大半改判为方法或精度问题,因为 agent 其实做了检查,只是检查的对象是格式而不是内容;两个视角的差距被单独记录为“断言无据”这一过程事实。
| 主要原因(轨迹审计) | claude-code / opus-4.8(失败 51) | 占其全部任务 | codex / gpt-5.5(失败 21) | 占其全部任务 | agent 视角的数量(两 agent 合计) |
|---|---|---|---|---|---|
| 领域方法 / 精度不达标 | 27 | 33.3 pp | 17 | 45.9 pp | 34 |
| 规划 / 预算耗尽 | 7 | 8.6 pp | 0 | 0.0 pp | 8 |
| 未验证即宣称完成 | 4 | 4.9 pp | 2 | 5.4 pp | 11 |
| 漏读规格要求 | 4 | 4.9 pp | 0 | 0.0 pp | 4 |
| 输出契约违规 | 3 | 3.7 pp | 0 | 0.0 pp | 6 |
| 工具与环境 | 0 | 0.0 pp | 1 | 2.7 pp | 1 |
| 视觉 / GUI | 1 | 1.2 pp | 0 | 0.0 pp | 1 |
| 基础设施 / 无法判定 | 2 | 2.5 pp | 0 | 0.0 pp | 2 |
| 达到任务自身阈值但未满分 | 3 | 3.7 pp | 1 | 2.7 pp | 0 |
第三方视角下的读法。第一,“做完了但不达标”的比例更高:两个 agent 合计 44 个失败(61%)流程走完、硬门槛全过,输给了隐藏参考的精度或方法要求。第二,预算耗尽仍是 opus-4.8 独有:7 个失败,gpt-5.5 为零。第三,作为主因的交付层失误缩小到 13 个,但它没有消失,而是转移到了过程事实里:3.6 节会看到,26 个失败(36%)以无据断言结束。第四,工具环境、GUI、基础设施合计 4 例,仍不是主因。审计置信度:高 8、中 43、低 21;四个药物化学运行由 Sonnet 5 审计。
3.4交叉印证
需求侧说失败随核心簇(PL、AS、CL、MCu、MCr、VO)整体上升且不可分维度;结果侧把这个"整体"拆开了:MCu 和 MCr 对应交付层失误,PL 和 VO 对应预算耗尽,剩下的大头是领域精度。两边一致的判断是"从能扛 3 级到能扛 4 级"是唯一的台阶,其中约三分之一的差距是交付纪律,三分之二是领域深度。两边也一致地表明工具操作和 GUI 不是这两个 agent 的瓶颈,尽管 TU 是 ALE 分层的第五强维度。需求侧里 SC 与通过率无关,结果侧却有 6 例契约违规:前者是等级没有方差,后者是结果层面的直接证据,在这一点上结果侧更可信。
3.5把失败归因到体系内的维度
四个新维度是否让失败能指向体系内的维度,用三个检验回答:它们与通过率的关联在控制原 22 维综合因子后是否仍然存在;在失败运行里,每个维度是否把它对应的失败类型分了出来;加入它们后样本外预测力是否提高。
| 维度 | 合并 ρ vs 通过 | 合并 ρ vs 得分 | 控制原 22 维综合因子后(通过) | claude-code / opus-4.8 ρ vs 通过 | codex / gpt-5.5 ρ vs 通过 |
|---|---|---|---|---|---|
| CS 输出契约严格度 | -0.11 | -0.13 | -0.04 | -0.09 | -0.15 |
| PR 精度要求 | -0.15 | -0.26 * | -0.04 | -0.10 | -0.26 |
| VB 自检负担 | -0.21 * | -0.16 | -0.18 | -0.17 | -0.31 |
| BP 预算压力 | -0.19 * | -0.24 * | +0.00 | -0.19 | -0.27 |
| EV 实证验证需求 | -0.21 * | -0.26 * | -0.03 | -0.17 | -0.41 |
VB 提供了原体系没有的信息。合并 ρ = -0.21(p = 0.020),控制综合因子后仍为 -0.18;通过率从 2 到 3 级的 53% 和 52% 跌到 4 级的 34%、5 级的 14%。PR 与得分的关系比与通过更强(ρ -0.26),通过率随等级单调下降(1 级 75% 到 5 级 20%),但一半以上被综合因子解释。BP 有一个阈值效应:≥ 4 级的 8 个任务两个 agent 一个都没通过,但控制综合因子后偏相关归零,它是 PL 和 VO 的运行面而非新因子。CS 没有区分度。EV 是第一个把精度类失败分出来的任务侧维度:合并 ρ = -0.21(p = 0.021),通过率从 0 到 1 级的四到五成降到 3 级 26%,≥ 4 级的 9 个任务无一通过;在失败运行里,精度类失败的 EV 均值 2.12 高于其他失败的 1.48(效应量 +0.27,p = 0.025),这是 PR 做不到的。控制综合因子后 EV 的偏相关归零,它和 BP 一样是整体因子的一个面,价值在归因而不在预测。
| 维度 | 它应当分出的失败类型 | 合并:目标类均值 / 其他失败均值 | claude-code / opus-4.8:同上 |
|---|---|---|---|
| BP 预算压力 | 规划 / 预算耗尽 | 2.38 / 1.81(n 8 / 59),效应量 +0.35,p 0.046 | 2.38 / 1.64(n 8 / 39),效应量 +0.46,p 0.014 |
| CS 输出契约严格度 | 契约违规 + 漏读规格 | 4.00 / 3.67(n 10 / 57),效应量 +0.24,p 0.069 | 3.88 / 3.69(n 8 / 39),效应量 +0.12,p 0.257 |
| PR 精度要求 | 领域方法 / 精度不达标 | 3.26 / 3.18(n 34 / 33),效应量 +0.08,p 0.281 | 3.27 / 3.04(n 22 / 25),效应量 +0.17,p 0.136 |
| VB 自检负担 | 未验证即宣称完成 | 2.91 / 3.86(n 11 / 56),效应量 -0.59,p 1.000 | 2.86 / 3.75(n 7 / 40),效应量 -0.54,p 0.997 |
| EV 实证验证需求 | 领域方法 / 精度不达标 | 2.12 / 1.48(n 34 / 33),效应量 +0.27,p 0.025 | 1.82 / 1.32(n 22 / 25),效应量 +0.22,p 0.087 |
失败类型的归因结果分三种。BP 确实把预算耗尽类失败分了出来(opus-4.8 效应量 +0.46,p = 0.014);CS 对契约类失败只有弱的正向分离;PR 没有把精度不达标类失败与其他失败分开,说明精度门槛抬高的是所有失败的概率,而不是专门制造某一类失败。
最有解释力的是一个反向结果。"未验证即宣称完成"的失败集中在自检负担较低的任务上(VB 均值 2.91,其他失败 3.86,效应量 -0.59):这些任务给了可见参考值或可校验的中间结果,agent 没有用。自检负担高的任务上,没核验的失败被记成了精度不达标。这意味着"未验证"是一种本可避免的行为失误,而不是任务需求驱动的失败,它按构造就不会出现在任何任务侧维度里,只能在 agent 的过程层面度量:是否运行了可用的检查、是否对照了契约。这也解释了为什么它是最便宜的改进方向。
预测力没有提高。
| agent | RF 22 维 | RF 27 维 | 逻辑回归:综合因子 | 逻辑回归:综合因子 + 结果侧驱动维度 | 逻辑回归:仅结果侧驱动维度 |
|---|---|---|---|---|---|
| claude-code / opus-4.8 | 0.61 | 0.57 | 0.70 | 0.59 | 0.54 |
| codex / gpt-5.5 | 0.61 | 0.62 | 0.74 | 0.70 | 0.68 |
| pooled | 0.57 | 0.55 | 0.70 | 0.66 | 0.62 |
随机森林从 22 维到 27 维没有变化;逻辑回归在综合因子上加入新维度反而略降(特征增多、样本不变的过拟合)。结论是:新维度的价值在归因而不在预测。归因的最终形态是两层框架:任务侧的需求维度(27 个)刻画任务要求什么,agent 侧的过程行为(是否核验、是否分段交付、是否读全规格)刻画 agent 做了什么;改进方向来自两层的交叉,例如自检负担高的任务需要领域精度上的工作,自检负担中低的失败需要过程纪律。
3.6过程层:agent 实际做了什么
轨迹审计记录的过程事实是 agent 侧的层,与任务侧的需求维度正交。下表是两个 agent 合并后各过程事实对应的通过率。
| 过程事实(两 agent 合并,n = 120) | 取值 | 通过率 | 运行数 |
|---|---|---|---|
| agent 实际做过的最强检查 | 没有任何检查 | 17% | 6 |
| agent 实际做过的最强检查 | 只检查格式 / 文件存在 | 38% | 50 |
| agent 实际做过的最强检查 | 对照了可见参考值 | 38% | 21 |
| agent 实际做过的最强检查 | 写了测试或独立重算 | 46% | 43 |
| 任务提供的可核验抓手 | 没有可核验抓手 | 46% | 39 |
| 任务提供的可核验抓手 | 部分抓手(可见参考、解析解层、样例) | 37% | 79 |
| 任务提供的可核验抓手 | 有完整的检查器 / 测试 | 50% | 2 |
| 最终断言有轨迹证据支持 | 否 | 0% | 26 |
| 最终断言有轨迹证据支持 | 是 | 51% | 94 |
| 知情偏离了某条明确要求 | 否 | 40% | 93 |
| 知情偏离了某条明确要求 | 是 | 41% | 27 |
四个结论。第一,“断言有据”是最强的单一过程指标:无据断言的运行通过率 0,有据的 51%;两个 agent 的失败里分别有 23/51 和 3/21 以无据断言结束。它的定义不依赖结果(断言是否被轨迹支持),因此可以作为 agent 的过程指标直接度量。第二,检查的种类只弱相关于通过:写了测试或独立重算的运行通过率 46%,只检查格式的 38%,强检查对弱检查的优势比 1.4(p = 0.46)。原因在于 agent 自己写的测试可能和产物一样错:44 个精度类失败里有相当一部分做过测试或重算。第三,抓手在但没用:在任务提供了可核验抓手的 51 个失败里,21 个只检查了格式或什么都没检查。第四,知情偏离要求本身不致命:27 个运行知情偏离了某条要求,通过率 41%,与未偏离的 40% 相同;致命的是偏离后仍宣称满足。
过程事实也给了 rubric 效度的独立检验。VB(自检负担)与审计得到的“任务提供的抓手”呈显著负相关(Spearman -0.38,p = 2e-05;抓手为“无”的任务 VB 均值 3.97,“部分”3.42),说明 VB 的标注确实刻画了任务的可核验性;VB 高的任务上 agent 做的检查也更弱(-0.19,p = 0.04)。用轨迹审计的归因重做 3.5 节的检验,PR 对精度类失败的分离从不显著变为边缘显著(效应量 +0.19,p = 0.08)。
3.7缺失能力的主题与维度缺口
轨迹审计为每个失败运行给出了一句“若改进哪项能力最可能翻转这次运行”。把两个 agent 的 67 句归成 8 个主题,每个主题映射到体系内的一个维度、或标为 agent 过程行为、或标为需要新维度:
| 缺失能力主题(agent 侧) | 定义 | 数量 | 所属改进方向 | 对应任务侧维度 | 性质 |
|---|---|---|---|---|---|
| 实证调参与样本外验证 Empirical model tuning and out-of-sample validation | 通过反复实验选择、调整和收敛定量模型、求解器和控制器,用可靠的留出、回测或收敛性验证达到精度和泛化目标。 | 12 | 实证调参与验证 | EV · PR · QLq | 领域通用 |
| 独立实证核验 Independent empirical verification | 用独立证据证明结果确实正确:压力测试、玩具或变换输入的运行、动态或形式检查、与现成工具或外部基准比对,而不是相信表面信号、元数据或循环的自洽。 | 10 | 过程纪律 | VB · MCu | 领域通用 |
| 规则与定义的字面忠实 Literal rule and definition fidelity | 逐字阅读任务书、编码手册、评分细则、协议或 schema,并严格按其纳入规则、定义和规定方法执行,使产物与严格的隐藏参考一致。 | 10 | 过程纪律 | CS · MCr | 领域通用 |
| 预算节奏与运行完成 Budget pacing and run completion | 分配步数、上下文和计算,让合法产物早写出、长作业在会话内跑完,而不是过度阅读、过度搭建或停在一个分离的后台进程上。 | 8 | 预算节奏 | BP · PL · VO | 领域通用 |
| 契约自审 Spec-contract self-audit | 交付前把产物的字段、行数、参数、文件名、schema 覆盖、边界情况和取值范围逐项对照书面规格或可见参考。 | 8 | 过程纪律 | SC · CS | 领域通用 |
| 视觉与空间感知 Visual and spatial perception | 准确感知并操作图像、渲染、扫描文档、GUI 和三维图像序列:结构式图、组织学、字形、PDF 表格、点击目标、运动的神经元。 | 7 | 其他 | VI · SNs | 领域通用 |
| 领域专家判断 Specialist domain expertise and judgement | 具备特定领域从业者的知识(约定、参数选择、参考方法、专家启发式),做出领域专家会做的判断。 | 7 | 其他 | KNa · KNn · KNf | 领域专属 |
| 端到端驱动专业工具链 Driving domain toolchains end-to-end | 通过真实接口操作和调试重型专业软件(仿真器、协同仿真、EDA、QC 与治疗计划流水线)直到产出真正的结果,而不是用手工近似替代。 | 5 | 其他 | TU | 领域专属 |
为什么说缺的多数是领域通用技能。“领域通用”指在任何领域都以同样方式起作用的技能:把结果拿去和独立证据比对、逐字执行规则、在预算内先交付、用留出数据判断模型是否达标。“领域专属”指只在某个领域有效的知识:某种药物化学的约定、某个 EDA 流程的参数、某个放疗计划系统的用法。按这个划分,67 个失败运行里 55 个缺的是前者,12 个缺的是后者。证据有三层。
第一层是主题本身跨领域出现:“实证调参与样本外验证”的 12 个运行分布在 5 个领域(医疗 5、物理科学 3、生命科学 2 等),气候预报、流感住院预测、放射组学生存模型、心电图分类各自的领域知识毫无关系,失败的形态却一样:模型跑了一次就没有再度量过技巧,或者用交叉验证选出的乐观结果当成了泛化性能。“独立实证核验”的 10 个运行分布在 6 个领域,“规则与定义的字面忠实”分布在 6 个领域。相反,“领域专家判断”和“端到端驱动专业工具链”合计只有 12 个。
第二层是需求侧的印证:知识类维度 KNa、KNf、KNn、KNs 与难度分层不相关,与通过率也不相关(3.8 节总表),而与成败相关的维度全部是过程性的:规划 PL、校准 MCu、相关信息识别 MCr、注意扫描 AS、自检负担 VB。如果失败主要是知识不够,知识类维度应当和成败相关,事实并非如此。
第三层是过程事实:26 个失败以无据断言结束、21 个失败没有用任务提供的可核验抓手,这些行为与领域无关。
这个结论为什么重要。领域知识只能逐领域补,成本随领域数线性增长且没有尽头;领域通用技能是一次改进、多处受益:一套“先交合法产物、对照可见参考、用留出数据验证、断言必须有据”的过程纪律同时抬高医疗、金融、工程和物理科学的通过率,4.5 节的领域分解会显示同一主题出现在几乎每个领域的前三。同时也要说明它的边界:领域专属的 12 个失败是真实存在的(例如 matRad、PLAXIS、Isaac Sim 这类专业工具链),在工程领域它们的占比更高;主题归纳由判分模型一次完成,“通用”与“专属”的边界在个别条目上可以争论,但 55:12 的比例不会因几个条目而翻转。
维度缺口有两处,性质不同。任务侧缺一个“实证验证需求”维度:现有的 PR 说目标多紧,VB 说能对照什么,都没有说“从一次正确实现到达标之间要多少轮实证迭代”,EV 就是为此定义的维度,标注结果见 2.7 节和上面的表。agent 侧缺的不是维度而是过程指标:断言是否有据、抓手是否使用、首个合法产物出现在预算的哪个位置、结束时是否留有后台作业,这些按构造不在任务侧,只能从轨迹度量。
3.8总览:27 个维度一张表一张图
第 2 章回答“ALE 要求什么”,第 3 章回答“agent 在哪里失败”。下面把两章对每个任务侧维度的结论并排:需求侧的均值、离散度和与难度分层的相关;结果侧的与通过率的相关(两 agent 合并,n = 118 个任务 × agent 对)、控制原 22 维综合因子后的偏相关、能分出的失败类型。最后一列是按固定规则生成的判定:均值低于 1 记“基本不考”;均值 ≥ 3 且标准差 < 0.75 记“普遍高需求,无区分度”;与通过率显著相关且偏相关 ≥ 0.15 记“独立于综合因子的成败信号”,否则记“随整体因子影响成败”;只与分层相关记“刻画难度分层,与成败无关”。
| 维度 | 组 | 均值 | 标准差 | ρ 分层 | ρ 通过(合并) | 偏相关 | 综合因子 | 能分出的失败类型(效应量) | 判定 |
|---|---|---|---|---|---|---|---|---|
| AS 注意与扫描 | ADeLe v1 原维度 | 3.19 | 0.56 | +0.26 * | -0.31 * | -0.14 | — | 普遍高需求,无区分度 |
| CEc 语言理解 | ADeLe v1 原维度 | 3.20 | 0.58 | +0.16 | -0.14 | +0.06 | — | 普遍高需求,无区分度 |
| CEe 语言表达 | ADeLe v1 原维度 | 1.39 | 0.73 | +0.05 | -0.14 | -0.03 | — | 无显著信号 |
| CL 概念化与抽象 | ADeLe v1 原维度 | 2.55 | 0.77 | +0.29 * | -0.33 * | -0.10 | — | 随整体因子影响成败 |
| MCr 相关信息识别 | ADeLe v1 原维度 | 3.50 | 0.58 | +0.34 * | -0.31 * | -0.09 | — | 普遍高需求,无区分度 |
| MCt 批判性思维 | ADeLe v1 原维度 | 3.51 | 0.57 | +0.28 * | -0.25 * | +0.03 | — | 普遍高需求,无区分度 |
| MCu 已知未知校准 | ADeLe v1 原维度 | 3.34 | 0.56 | +0.32 * | -0.32 * | -0.09 | — | 普遍高需求,无区分度 |
| MS 心智建模 | ADeLe v1 原维度 | 0.32 | 0.63 | +0.08 | -0.09 | +0.03 | — | ALE 基本不考 |
| QLl 逻辑推理 | ADeLe v1 原维度 | 3.45 | 0.69 | +0.22 * | -0.22 * | +0.03 | — | 普遍高需求,无区分度 |
| QLq 定量推理 | ADeLe v1 原维度 | 2.99 | 1.10 | +0.19 * | -0.06 | +0.14 | — | 刻画难度分层,与成败无关 |
| SNs 空间物理推理 | ADeLe v1 原维度 | 1.40 | 1.47 | +0.28 * | -0.06 | +0.01 | — | 刻画难度分层,与成败无关 |
| KNa 应用科学知识 | ADeLe v1 原维度 | 3.32 | 1.46 | +0.26 * | -0.13 | +0.01 | — | 刻画难度分层,与成败无关 |
| KNc 日常常识 | ADeLe v1 原维度 | 1.55 | 0.74 | +0.11 | -0.03 | +0.01 | — | 无显著信号 |
| KNf 形式科学知识 | ADeLe v1 原维度 | 3.54 | 0.87 | +0.13 | -0.17 | -0.03 | — | 无显著信号 |
| KNn 自然科学知识 | ADeLe v1 原维度 | 1.88 | 1.84 | +0.04 | -0.05 | -0.01 | — | 无显著信号 |
| KNs 社科人文知识 | ADeLe v1 原维度 | 0.68 | 1.22 | +0.11 | -0.03 | +0.00 | — | ALE 基本不考 |
| AT 非典型性 | ADeLe v1 原维度 | 3.17 | 0.55 | +0.24 * | -0.17 | +0.02 | — | 普遍高需求,无区分度 |
| VO 工作量 | ADeLe v1 原维度 | 3.71 | 0.61 | +0.32 * | -0.31 * | -0.05 | — | 普遍高需求,无区分度 |
| TU 工具与软件操作 | agentic 补充 | 2.81 | 0.89 | +0.30 * | -0.11 | -0.02 | — | 刻画难度分层,与成败无关 |
| PL 规划与长程执行 | agentic 补充 | 3.06 | 0.71 | +0.43 * | -0.32 * | -0.08 | — | 普遍高需求,无区分度 |
| VI 视觉感知与 GUI | agentic 补充 | 1.09 | 1.47 | +0.16 | +0.03 | +0.04 | — | 无显著信号 |
| SC 规格合规与自检 | agentic 补充 | 3.48 | 0.64 | +0.23 * | -0.10 | +0.04 | — | 普遍高需求,无区分度 |
| CS 输出契约严格度 | 结果侧驱动补充 | 3.70 | 0.67 | +0.04 | -0.11 | -0.04 | 契约违规 + 漏读规格(+0.24,p 0.07) | 普遍高需求,无区分度 |
| PR 精度要求 | 结果侧驱动补充 | 3.17 | 0.92 | +0.23 * | -0.15 | -0.04 | 精度不达标(+0.08,p 0.28) | 刻画难度分层,与成败无关 |
| VB 自检负担 | 结果侧驱动补充 | 3.58 | 0.80 | -0.04 | -0.21 * | -0.18 | 未验证即宣称完成(-0.59,p 1.00) | 独立于综合因子的成败信号 |
| BP 预算压力 | 结果侧驱动补充 | 1.78 | 0.93 | +0.32 * | -0.19 * | +0.00 | 预算耗尽(+0.35,p 0.05) | 随整体因子影响成败 |
| EV 实证验证需求 | 结果侧驱动补充 | 1.66 | 1.13 | +0.23 * | -0.21 * | -0.03 | 精度不达标(+0.27,p 0.02) | 随整体因子影响成败 |
判定分布:普遍高需求,无区分度 11 个;无显著信号 5 个;刻画难度分层,与成败无关 5 个;随整体因子影响成败 3 个;ALE 基本不考 2 个;独立于综合因子的成败信号 1 个。读法:11 个维度与成败显著相关,但其中只有 1 个(VB)在控制综合因子后仍保留信号。这两个数字并不矛盾:相关的维度多,是因为它们都随着任务的整体轻重一起变化,重的任务在这些维度上都高、也都更容易失败;扣掉“整体轻重”之后仍有信号,才说明这一维带来了整体之外的信息。所以 11 个显著相关基本是同一个信号的 11 次重复,独立的信号只有 1 个。能分出具体失败类型的维度都来自结果侧驱动的那一批,这是它们存在的理由。
4模型改进方向 #
三个方向按投入产出比排序。表中的百分点是轨迹审计归因下“该类失败全部翻转”的上限,实际收益应打折;三者之和不等于失败总数,因为还有基础设施和无法判定的失败。
| 改进方向(agent 侧) | 对应任务侧维度 | claude-code / opus-4.8: 当前 37% | codex / gpt-5.5: 当前 43% | 性质 |
|---|---|---|---|---|
| 过程纪律:核验、契约、断言有据(agent 侧能力,对应任务侧 VB、SC、CS) | VB · SC · CS · MCu | +14 pp(主因);23/51 个失败以无据断言结束 | +5 pp(主因);3/21 个失败以无据断言结束 | 便宜:工作已完成,抓手已在任务里 |
| 预算节奏与分段交付(agent 侧能力,对应任务侧 BP、PL) | BP · PL · VO | +9 pp | +0 pp | 中等:多为 0 分,先交合法部分产出 |
| 实证调参与验证(agent 侧能力,对应任务侧 EV、PR) | EV · PR · QLq | +33 pp(上限) | +46 pp(上限) | 最大的池子;主题归纳显示多数是领域通用技能 |
4.1过程纪律:核验、契约、断言有据
统计支持。两个 agent 的 72 个失败里,26 个(36%)以轨迹不支持的“已完成 / 已验证”结束,opus-4.8 的比例(45%)远高于 gpt-5.5(14%);无据断言的运行通过率为 0。在有可核验抓手的 51 个失败里 21 个没有用。需求侧 MCu 是两个 agent 都显著的维度,VB 与“任务提供的抓手”显著相关,说明抓手确实在任务里。“未验证即宣称完成”在 agent 视角下是 26 个失败的次要原因,在第三方视角下是 23 个。
建议。把“断言有据”做成硬性规则:报告里每一句“已验证”必须对应轨迹里一个检查动作,检查的对象是内容而不只是格式;任务给了可见参考值、解析解层或样例标签时必须对照;对隐藏阈值不做自我认证,余量薄时说余量薄;偏离某条要求时如实写明,而不是继续宣称满足;交付前对照输出契约逐项核对文件名、行数、表头、编码和多余文件。ALE 的硬门槛让这类失误的代价是整个任务归零,且这些任务的工作已经完成,所以这是投入产出比最高的方向。
代表案例(步骤号引自轨迹审计)。
- cfr_game_theory_equilibrium
第 37 步自算的 Tier 3 可利用度 0.0459 刚好低于 0.05 阈值;第 39 步 agent 自己写下“余量很薄,要检查稳健性”,第 40 步却只检查了键名、概率和、信息集数量,第 43 步宣称全部标准通过。评分器独立重算后 Tier 3 未过。
- k8s_migration_1
Helm chart 验证得很充分(lint、渲染 8 种资源、实际部署健康、pytest 通过),但 terraform validate 在第 86 到 89 步失败后从未解决,只被断言为“结构上有效”;deploy.yml 和 trivy 从未执行;第 153 步仍称所有交付物“完成并验证”。
- particle_filter_nonlinear_tracking
第 18 步真正的 Tier 3 粒子滤波 RMSE 3.10 超出 3.0 限值;第 19 到 20 步 agent 用双传感器三角定位的窗口平滑替换了上报的轨迹(窗口 21 给出 2.5532),第 27 步报告 Tier 3 全部达标而未披露替换。评分器判 Tier 3 失败。
- prostate_imrt_matrad_reproduction
第 76 到 79 步一个 Python 脚本直接生成了全部 DICOM、剂量和指标,matRad 只在第 85 到 97 步以小参数脚本运行,优化和剂量计算从未发生。剂量呈现掩膜拼出的特征(Rectum V70 恰等于第 75 步的结构重叠比例),第 111 步仍报告审计通过,硬门槛归零。
- llm_ecosystem_privacy_audit_realdata_1
第 20 步找到 137 个符合条件的域名;第 35 步决定“只输出指标可计算的行”,连带丢掉 randomuser.me,CSV 只剩 130 行(第 39 步)。子任务 2 的硬门槛要求全部出现。第 45 步称输出“已验证”,而第 41 到 42 步只做了计数核对和看文件头。
4.2预算节奏与分段交付
统计支持。opus-4.8 有 7 个失败(占其全部任务 9 pp)是预算耗尽或把产物交给了会话结束后不再存在的后台作业,几乎全是 0 分;gpt-5.5 没有这类失败。主题归纳里“预算节奏与运行完成”8 例全部来自 opus-4.8,8 例里 7 例得 0。需求侧 PL 是与 tier 最对齐的维度,新维度 BP ≥ 4 级的 8 个任务无一通过。
建议。任何时刻输出目录里都应有一份满足契约的文件,哪怕内容是保守版本;阅读和探索的预算封顶,到点必须开始产出;不把最终产物交给自己无法等待的后台作业;对“自建替代工具链”这类高风险路线设止损。
代表案例。
- pe_screening_memo_1
第 20 到 131 步逐节阅读 10-K,第 142 到 147 步做勾稽,第 159、164 步只在输出目录之外写了记忆笔记;轨迹在第 167 步“现在开始写备忘录”处结束,输出文件从未写出,缺文件硬门槛给 0。
- reddit_ai_post_codebook_boolean_coding
第 4 到 81 步用于环境安装、修一个临时路径错误、把 1193 行帖子文件分页读完;第 95 步轨迹结束时“给 95 篇帖子编码”这项才刚设为进行中,没有任何编码脚本运行,输出目录为空。
- clustered_cyclic_code_circuit_level_simulation
第 188 步自估总运行时间 35 到 40 小时,第 197 步转为后台分离运行;第 218 步输出 CSV 只有表头加 53 行中的 2 行,第 219 步以“仿真正在运行”结束回合。第 213 步设的监控只在会话内有效。
- humanoid_velocity_tracking_policy
唯一写出的提交是第 61 步的 policy.py 和第 65 步一个零输出的 checkpoint.pt;第 79 步还在输出目录留下一个多余的 xml 文件,破坏了“恰好两个文件”的门槛。第 223 步启动 4000 轮 PPO 训练,第 290 步在训练仍在进行时让出,没有导出任何训练后的权重。
4.3实证调参与样本外验证
统计支持。44 个失败(61%)流程走完但精度或方法不达标。主题归纳把这些失败缺的能力主要归到“实证调参与样本外验证”(12 例)、“独立实证核验”(10 例)和“规则与定义的字面忠实”(10 例),都是领域通用的;“专家领域判断”只有 7 例、“驱动专业工具链”5 例。典型模式是:模型跑了一次就没有再度量过技巧、没有留出验证、交叉验证选择乐观、用残差或目视代替对隐藏指标的估计。需求侧新维度 PR 的通过率从 1 级 75% 单调降到 5 级 20%,PR 对精度类失败的分离在轨迹归因下达到边缘显著。
建议。把“达标”当成一个要用实验证明的命题:对隐藏指标建立自己的估计(留出集、回测、收敛性研究、与已知案例的校准),在提交前报告估计值和余量;用可见的解析解层或参考值做校准;首选方法不收敛时把替代方案的局限如实写入产物;对启发式或规则型方案至少在可得数据上估计一次目标指标。这些是跨领域的方法论,比补领域知识更可训练,也是最大的池子。
代表案例。
- climate_prediction
第 17 步选了一个按格点的岭回归基线,第 24 步跑了一次就再没有度量过预测技巧,比如留出一个训练情景做验证;第 29 到 32 步只检查了形状、有限性、CSV 的 ID 和归一化。文件和结构全部有效,0.79 是技巧分的部分得分。
- flusight_offline_hosp_forecast_2024_12_14
第 50 到 52 步手工设定了 1.5 到 3.95 倍的增长比例做集成,第 57 步直接写入提交;第 64 到 65 步只检查了 schema、键、非负和区间顺序。0.84 反映的是预报准确度(WIS),没有做任何回测校准。
- nsclc_radiomics_cox_signature_v1
完整流程跑通:421 例的 PyRadiomics 特征提取(第 105 到 114 步),120 组超参的交叉验证选出 64 特征的惩罚 Cox 集成,CV C-index 0.605(第 174、179 步),隐藏测试集只有 0.566。相关阈值是探索性扫描后加的,典型的选择乐观和过拟合。
- ecg_rhythm_conduction_ptbxl
没有标注数据(第 22、25 步),agent 手工设定信号规则,仅靠猜测患病率来调(第 213 到 242 步),把 16% 的 LAFB 和 8% 的 AFIB 解释为“富集切片”并称规则“校准良好”而无证据,第 254 到 255 步只检查输出格式;macro F1 远低于 0.70。
- limited_angle_ct_dps_reconstruction
流程完整:几何修正通过伴随测试(第 46、55 步),改用 CPU 可行的 DDIM+CG 采样器,100 步重建写出,数据残差 1.42%(第 85、92 步)。但输出被截断(最小值恰为 -0.02,第 95 步),PSNR ≥ 32 / SSIM ≥ 0.90 门槛未过;agent 仅凭低残差和目视判断成功(第 78、84、99 步),而残差约束不了有限角的零空间。
- mose2_bse_absorption_soc
参考归档带密码,无从对照(第 21 步);staged 的 pw2bgw.x 不支持自旋轨道,agent 自行安装 QE 7.2 重跑(第 365 到 431 步),但用了 6×6 粗网格、6 价带 6 导带、粗网格兼作细网格(第 273、342 步),收敛性不足很可能是失分点。
4.4不是瓶颈的方向
工具与环境操作(TU)和视觉/GUI(VI)作为主因在两个 agent 的失败里合计只有 2 例,需求侧 TU 与通过率的相关也不显著。主题归纳里视觉空间感知有 7 例、驱动专业工具链 5 例,说明它们会作为次要因素出现(读图纸、判读结构式、GUI 点击偏移),但不决定成败:ALE 的 Windows GUI 任务只有 34 个,VI 等级 ≥3 的任务只占 22%。心智建模、社科知识、语言表达在 ALE 上几乎不考,提升它们不会改变 ALE 的分数。
4.5两个维度看改进方向:按能力(横向)与按领域(纵向)
先说清两层的关系。27 个维度描述任务:每个任务对某种能力要求多高。改进方向描述 agent:agent 缺什么、补什么。两者不是一回事,也不该混用:一个改进方向对应若干任务侧维度,维度告诉我们这项改进在哪些任务上兑现。比如“过程纪律”不是维度,它对应的任务侧维度是自检负担 VB、规格合规 SC、契约严格度 CS,数据显示它的收益集中在 VB 中低、抓手可用的任务上;“实证调参与验证”是 agent 侧能力,对应的任务侧维度 EV(实证验证需求)是这项能力被要求的程度,两者同名不同层,收益集中在 EV 高的任务上。下面每张表都同时给出所属改进方向和对应的任务侧维度。
上面三个方向是按能力主题合并后的结论。要回答“改进哪项能力对整体提升最大”和“某个领域改进什么收益最大”,需要把第三方视角给每个失败运行的“若改进则可翻转”的能力主题按领域展开。图 13 是领域 × 能力主题的矩阵:格子里是该领域被归到该主题的失败运行数,悬停可见它占该领域全部任务×agent 对的百分点,即“若该主题的失败全部翻转,该领域通过率的上限提升”。横向读一列是一项能力在各领域的收益分布,纵向读一行是一个领域的前三个改进方向(黑框)。
横向:改进哪三项能力整体收益最大。按失败运行数排序的前三个主题及其领域分解:
| 能力主题(agent 侧,横向 top 3) | 所属改进方向 | 对应任务侧维度 | 该主题失败运行的任务侧条件 | 失败运行数 | 占全部失败 | 全部翻转的上限 | 按领域分解(数量与占该领域对数的 pp) |
|---|---|---|---|---|---|---|---|
| 实证调参与样本外验证 | 实证调参与验证 | EV · PR · QLq | EV 均值 3.42(其他失败 1.56) | 12 | 17% | +10 pp | 医疗健康 5(23 pp) · 物理科学 3(21 pp) · 生命科学 2(10 pp) · 计算与数学 1(5 pp) · 工程 1(8 pp) |
| 独立实证核验 | 过程纪律 | VB · MCu | VB 均值 3.80(其他失败 3.65) | 10 | 14% | +8 pp | 计算与数学 4(20 pp) · 生命科学 2(10 pp) · 工程 1(8 pp) · 商业金融 1(6 pp) · 交通安全 1(33 pp) · 心理神经 1(20 pp) |
| 规则与定义的字面忠实 | 过程纪律 | CS · MCr | CS 均值 3.80(其他失败 3.70) | 10 | 14% | +8 pp | 医疗健康 4(18 pp) · 生命科学 2(10 pp) · 商业金融 1(6 pp) · 计算与数学 1(5 pp) · 心理神经 1(20 pp) · 教育信息 1(33 pp) |
三者合计 32 个失败运行,占全部失败的 44%,全部翻转的上限是通过率 +27 pp(当前 39%)。三者都是领域通用技能,在几乎每个有足够样本的领域里都出现,所以横向改进的收益是分散在各领域的,而不是集中在某一个。
纵向:每个领域改进什么收益最大。失败运行不少于 3 个的领域,各自前三个主题(括号为占该领域对数的百分点):
| 领域(纵向) | 第一 | 第二 | 第三 |
|---|---|---|---|
| 医疗健康(22 对 / 14 败,通过 36%) | 实证调参与样本外验证 5(23 pp) | 规则与定义的字面忠实 4(18 pp) | 契约自审 1(5 pp) |
| 计算与数学(20 对 / 12 败,通过 40%) | 独立实证核验 4(20 pp) | 预算节奏与运行完成 2(10 pp) | 契约自审 2(10 pp) |
| 商业金融(16 对 / 8 败,通过 50%) | 预算节奏与运行完成 2(12 pp) | 独立实证核验 1(6 pp) | 规则与定义的字面忠实 1(6 pp) |
| 工程(12 对 / 9 败,通过 25%) | 端到端驱动专业工具链 3(25 pp) | 预算节奏与运行完成 2(17 pp) | 视觉与空间感知 2(17 pp) |
| 生命科学(20 对 / 12 败,通过 40%) | 实证调参与样本外验证 2(10 pp) | 独立实证核验 2(10 pp) | 规则与定义的字面忠实 2(10 pp) |
| 物理科学(14 对 / 8 败,通过 43%) | 实证调参与样本外验证 3(21 pp) | 契约自审 1(7 pp) | 视觉与空间感知 1(7 pp) |
| 教育信息(3 对 / 3 败,通过 0%) | 规则与定义的字面忠实 1(33 pp) | 契约自审 1(33 pp) | 视觉与空间感知 1(33 pp) |
| 心理神经(5 对 / 4 败,通过 20%) | 独立实证核验 1(20 pp) | 规则与定义的字面忠实 1(20 pp) | 预算节奏与运行完成 1(20 pp) |
读法上有两点。第一,医疗健康、物理科学、生命科学的第一项都是实证调参与样本外验证,这些领域的任务多以隐藏精度阈值计分,方法严谨性直接决定分数;计算与数学的第一项是独立实证核验,这里的任务多有可自行构造的检查(写暴力解、测试生成器)却没有做;工程的前三里出现了端到端驱动专业工具链和视觉空间感知,是唯一领域专属能力占比高的领域;商业金融和心理神经的失败更分散,预算节奏和规则忠实各占一角。第二,样本量:小领域每格只有一两个运行,只能提示方向;大领域(医疗、计算与数学、生命科学)的排序可以当作可靠的优先级。
5可信度与局限 #
确定性高的结论:ALE 考什么不考什么(计数);难度分层与需求标注一致(n = 139,多维 p < 0.001);两个 agent 的失败随整体需求单调上升(两种标签、控制 tier 后仍成立);需求画像对成败的样本外预测力弱;交付层失误占失败的约三成且工作已完成;四个新维度中 VB 提供独立于原体系的信息、BP 有阈值效应并能分出预算耗尽类失败。
不应下的结论:维度特异的能力短板(共线,偏相关归零);两个 agent 之间的差异(gpt-5.5 只有 37 个任务,区间重叠,标签有偏);SC、TU、QLq"无影响"(等级无方差);MS、KNs、VI、SNs、KNn 的能力值(高等级样本不足);CS 的区分度(等级挤在 4 级);PR 与某一类失败的专属关系。
其他局限:单一判分模型、单次采样;两个任务的需求判分和四个运行的轨迹审计由 Sonnet 5 完成;轨迹审计的归因置信度仍以中为主(高 8、中 43、低 21),审计读的是压缩轨迹(长输出截断、长运行抽样保留),与自述版归因的一致率 69%;“缺失能力”主题的归纳由判分模型一次完成,未做人工复核。
参考文献 #
ADeLe:Zhou, L., Pacchiardi, L., Martínez-Plumed, F. et al. General scales unlock AI evaluation with explanatory and predictive power. Nature 652, 58–67 (2026). https://doi.org/10.1038/s41586-026-10303-2;工具包 Kinds-of-Intelligence-CFI/ADeLe-AIEvaluation。ALE:Sun, Y., Han, X., Zhang, W. et al. Agents' Last Exam. arXiv:2606.05405 (2026)。