数据 · 领域专家任务环境 · 证据

模型在专业任务上错在哪

2 个模型, 每个对首批样本的全部 57 个任务各完成 1 次, 共 114 次完整运行, 逐条判分。下面是结果、失败去向、能力维度, 以及判分方法本身。

114完整运行
57任务 · 5 个项目
15归零的运行
80%归零运行中其余判据全部满分
0条判据被判为不适用
§ 1 · Baseline

基线结果

均分按全部 57 个任务计, 归零计 0 分。两种判分形态的通过线不同, 分开计数: 锚点类 25 个任务得分 ≥ 0.9 计为通过; 评审类 32 个任务须满分才计为通过。

1GLMglm-5.3
0.786均分
10/25锚点类通过
23/32评审类通过
7/57归零
2DeepSeekdeepseek-v4-flash
0.739均分
3/25锚点类通过
20/32评审类通过
8/57归零

按 57 个任务计, 均分 0.786 对 0.739。差距主要来自锚点类项目(通过 10 对 3); 在评审类项目上两者接近, 且在不同项目上强弱相反 —— 16 个评审类任务两者都通过, 2 个两者都归零, 11 个一方通过、另一方未通过。

业务项目GLMDeepSeek
法律 · 不正当竞争诉讼应诉判据评审 · 12 个任务0.833
通过 10/12 · 归零 2
0.875
通过 10/12 · 归零 1
法律 · 跨境并购法律尽职调查判据评审 · 12 个任务0.809
通过 6/12 · 归零 2
0.802
通过 4/12 · 归零 2
采购与供应链 · 年度供应商绩效考核判据评审 · 8 个任务0.875
通过 7/8 · 归零 1
0.750
通过 6/8 · 归零 2
财税 · 企业智能开票全流程改造确定性锚点 · 10 个任务0.704
项目级汇总
0.681
项目级汇总
电力工程 · 110kV 线路工程监理全周期资料确定性锚点 · 15 个任务0.738
项目级汇总
0.613
项目级汇总

每格为该项目上的均分, 加粗为该项目领先者。锚点类项目以项目级汇总值计入, 未列逐任务的通过与归零。

得分区间GLMDeepSeek
0 – 0.6(含归零)1214
0.6 – 0.7525
0.75 – 0.8546
0.85 – 0.924
0.9 – 1.03728

全部 57 个任务的得分分布(任务数)。

§ 2 · Failure modes

失败去向

每次未通过的运行只归入一个原因 —— 负面规则优先于关键要求, 关键要求优先于加分项。进度条为该类占全部未通过的比例, 下方为它在两个模型各自运行中的占比。

归零的运行里, 80% 的其余判据全部满分, 80% 只栽在一条关键要求或负面规则上。专业工作的失败往往不是「整体做得差」, 而是「一处关键错误」—— 这正是关键要求一票否决的理由。

§ 3 · By dimension

能力维度

把判据按考察内容归为五个维度, 以重要度加权计算每个模型在该维度上的得分; 归零任务的全部判据计为未得分。每个维度只在有对应逐条结果的项目上聚合, 统计范围见第二列。

维度统计范围GLMDeepSeek
事实与依据
事实、数值、法条与出处是否准确
4 个项目0.8130.813
分析与判断
定性、测算、归类与建议是否成立
3 个项目0.8320.837
覆盖完整
该列的事项是否列全
4 个项目0.8360.891
交付形式与结构
文件、章节、字段与格式是否符合要求
4 个项目0.8010.787
盖章与图片放置
印章是否盖在标注位置、选用是否正确
1 个项目0.6480.607

「盖章与图片放置」只出现在电网工程监理资料项目中; 「分析与判断」只出现在评审类项目中。其余三个维度两个模型差距不大, 差别主要体现在「哪一处关键要求没做到」。

§ 4 · Cases

典型失败: 这些任务在考什么

按任务最能考验的能力选取五类失败, 每一类都对应专业工作中的一项基本功。案例均取自上面的基线运行, 判分证据经改写, 隐去当事方名称与具体数字。

信息不完整时不越界下结论专业上: 执业审慎: 材料没写的事, 不写成已查明的事实 · 任务: 并购尽调 · 融资与资金状况审查

现金能支撑多久的起算日和签约日期都没有载明, 正确做法是把「交割是否落在现金覆盖期内」作为附条件的测算。GLM 直接断言两者「基本重合」, 关键要求未满足而归零。同一类问题也出现在专利质押清单中: 材料没有记载个人担保的发生时间, GLM 却称两笔担保「时点吻合」, 并以此作为同一笔债务的佐证; DeepSeek 没有编造时间, 但也没把它列为待核。

专业概念辨析专业上: 区分前一轮融资估值与本次交易对价 · 任务: 并购尽调 · 风险评估与交易建议

DeepSeek 把前一轮融资的投后估值当成本次交易对价, 以此为基数反复计算门槛, 并推出「领售权因价格条件不满足而无法行使」的结论。概念一错, 后续的计算和法律判断全部建立在错误的基础上 —— 触发两条严重负面规则, 归零。

引用精确到条、款、项专业上: 法律意见中的每一处引用都要能对照原文核验 · 任务: 诉讼应诉 · 权益属性与公开状态核查

DeepSeek 在 5 处把商业秘密的定义引为某条第四款, 而材料中的法条节选该定义位于第三款、根本没有第四款; 其他地方又按另一种口径编号, 前后不一。引用无法对照核验, 关键要求未满足而归零。GLM 在同一任务上满分。

判断两条记录是否真的矛盾专业上: 一致性核对要区分「事实冲突」与「身份并存」, 误报冲突会把尽调注意力引向错误方向 · 任务: 并购尽调 · 风险清单与数据一致性核对表

同一家供应商在合同汇总里是联合开发伙伴, 在行业报告里是同业竞争者。两种身份可以同时成立, 应如实记为身份重合, 保密条款缺失的风险另行说明。两个模型都把它判成「两处记载冲突」: GLM 直接标为不一致, 该项不得分; DeepSeek 同样标为不一致, 只得一半。两个模型在同一处犯了同一个推理错误 —— 逐字比对两份材料看不出这里有没有矛盾, 要理解两种身份各自的含义才能判断。

识别信息缺口专业上: 把决策前必须补齐的事实列成待核清单 · 任务: 诉讼应诉 · 管理层决策简报 / 制度修订建议

决策简报要求单列待核事项, GLM 列了 17 项, 却漏掉了和解条件这一整类信息(对方可接受的范围、授权与处置条件); 制度修订建议中, GLM 同样漏列了「推送是否标注数据来源」这一关键未载事实。两处都因关键要求未满足而归零, DeepSeek 在这两个任务上均为满分。

§ 5 · Method

判分方法

评分器随包分发, 判定规则与本页结果使用的完全一致。

关键要求一票否决

评审类: 关键要求只有「通过 / 未通过」两种结果, 不给部分分; 任一未通过, 任务得分归零。次要项堆得再多, 也补不回一条关键错误。

加分项分档加权

评审类: 加分项按「未满足 / 部分满足 / 满足」三档打分, 以重要度为权重加权平均。关键要求全部通过时, 任务得分等于加分项的加权得分。

负面规则

评审类: 专业上不可接受的错误做法单独列为负面规则, 命中即归零; 已被正向判据扣过分的同一问题不重复处罚。

确定性锚点

锚点类: 确定性脚本逐条检查判分锚点, 按权重加权(核心与事实 1.0, 补充 0.5), 同一交付物重复判分结果一致。

两条通过线

锚点类得分 ≥ 0.9 计为通过; 评审类要求满分才计为通过 —— 全部关键要求通过、加分项满分、且未命中负面规则。

判分必须给证据

每条判据的得分都引用交付物中的具体位置与内容; 没有证据不计分。评分器自身故障时不输出分数、单独标记为判分异常, 不会与 0 分混在一起。

§ 6 · Caveats

结果的适用范围

想看模型的完整交付与逐条判分?样本附逐条判据得分、判分证据与参考产出
申请样本

数据受样本评估许可约束(30 天 · 仅限评估)联系商务 · 申请样本最后更新 2026-09-29