模型在专业任务上错在哪
2 个模型, 每个对首批样本的全部 57 个任务各完成 1 次, 共 114 次完整运行, 逐条判分。下面是结果、失败去向、能力维度, 以及判分方法本身。
基线结果
均分按全部 57 个任务计, 归零计 0 分。两种判分形态的通过线不同, 分开计数: 锚点类 25 个任务得分 ≥ 0.9 计为通过; 评审类 32 个任务须满分才计为通过。
按 57 个任务计, 均分 0.786 对 0.739。差距主要来自锚点类项目(通过 10 对 3); 在评审类项目上两者接近, 且在不同项目上强弱相反 —— 16 个评审类任务两者都通过, 2 个两者都归零, 11 个一方通过、另一方未通过。
| 业务项目 | GLM | DeepSeek |
|---|---|---|
| 法律 · 不正当竞争诉讼应诉判据评审 · 12 个任务 | 0.833 通过 10/12 · 归零 2 | 0.875 通过 10/12 · 归零 1 |
| 法律 · 跨境并购法律尽职调查判据评审 · 12 个任务 | 0.809 通过 6/12 · 归零 2 | 0.802 通过 4/12 · 归零 2 |
| 采购与供应链 · 年度供应商绩效考核判据评审 · 8 个任务 | 0.875 通过 7/8 · 归零 1 | 0.750 通过 6/8 · 归零 2 |
| 财税 · 企业智能开票全流程改造确定性锚点 · 10 个任务 | 0.704 项目级汇总 | 0.681 项目级汇总 |
| 电力工程 · 110kV 线路工程监理全周期资料确定性锚点 · 15 个任务 | 0.738 项目级汇总 | 0.613 项目级汇总 |
每格为该项目上的均分, 加粗为该项目领先者。锚点类项目以项目级汇总值计入, 未列逐任务的通过与归零。
| 得分区间 | GLM | DeepSeek |
|---|---|---|
| 0 – 0.6(含归零) | 12 | 14 |
| 0.6 – 0.75 | 2 | 5 |
| 0.75 – 0.85 | 4 | 6 |
| 0.85 – 0.9 | 2 | 4 |
| 0.9 – 1.0 | 37 | 28 |
全部 57 个任务的得分分布(任务数)。
失败去向
每次未通过的运行只归入一个原因 —— 负面规则优先于关键要求, 关键要求优先于加分项。进度条为该类占全部未通过的比例, 下方为它在两个模型各自运行中的占比。
- 触犯负面规则占全部未通过 5%交付物中出现专业上不可接受的错误, 例如把前一轮融资估值当作本次交易对价并据此下结论。命中即归零。各模型运行中的占比: GLM 0% · DeepSeek 3%
- 关键要求未满足占全部未通过 43%交付物整体可用, 但某条关键要求没有做到, 例如证据位置不可复核、漏掉一类必须列出的事项。任务得分归零。各模型运行中的占比: GLM 16% · DeepSeek 12%
- 加分项未满占全部未通过 52%关键要求全部通过, 次要要求有缺失, 离通过只差一点, 按加分项得分计。各模型运行中的占比: GLM 12% · DeepSeek 22%
归零的运行里, 80% 的其余判据全部满分, 80% 只栽在一条关键要求或负面规则上。专业工作的失败往往不是「整体做得差」, 而是「一处关键错误」—— 这正是关键要求一票否决的理由。
能力维度
把判据按考察内容归为五个维度, 以重要度加权计算每个模型在该维度上的得分; 归零任务的全部判据计为未得分。每个维度只在有对应逐条结果的项目上聚合, 统计范围见第二列。
| 维度 | 统计范围 | GLM | DeepSeek |
|---|---|---|---|
| 事实与依据 事实、数值、法条与出处是否准确 | 4 个项目 | 0.813 | 0.813 |
| 分析与判断 定性、测算、归类与建议是否成立 | 3 个项目 | 0.832 | 0.837 |
| 覆盖完整 该列的事项是否列全 | 4 个项目 | 0.836 | 0.891 |
| 交付形式与结构 文件、章节、字段与格式是否符合要求 | 4 个项目 | 0.801 | 0.787 |
| 盖章与图片放置 印章是否盖在标注位置、选用是否正确 | 1 个项目 | 0.648 | 0.607 |
「盖章与图片放置」只出现在电网工程监理资料项目中; 「分析与判断」只出现在评审类项目中。其余三个维度两个模型差距不大, 差别主要体现在「哪一处关键要求没做到」。
典型失败: 这些任务在考什么
按任务最能考验的能力选取五类失败, 每一类都对应专业工作中的一项基本功。案例均取自上面的基线运行, 判分证据经改写, 隐去当事方名称与具体数字。
现金能支撑多久的起算日和签约日期都没有载明, 正确做法是把「交割是否落在现金覆盖期内」作为附条件的测算。GLM 直接断言两者「基本重合」, 关键要求未满足而归零。同一类问题也出现在专利质押清单中: 材料没有记载个人担保的发生时间, GLM 却称两笔担保「时点吻合」, 并以此作为同一笔债务的佐证; DeepSeek 没有编造时间, 但也没把它列为待核。
DeepSeek 把前一轮融资的投后估值当成本次交易对价, 以此为基数反复计算门槛, 并推出「领售权因价格条件不满足而无法行使」的结论。概念一错, 后续的计算和法律判断全部建立在错误的基础上 —— 触发两条严重负面规则, 归零。
DeepSeek 在 5 处把商业秘密的定义引为某条第四款, 而材料中的法条节选该定义位于第三款、根本没有第四款; 其他地方又按另一种口径编号, 前后不一。引用无法对照核验, 关键要求未满足而归零。GLM 在同一任务上满分。
同一家供应商在合同汇总里是联合开发伙伴, 在行业报告里是同业竞争者。两种身份可以同时成立, 应如实记为身份重合, 保密条款缺失的风险另行说明。两个模型都把它判成「两处记载冲突」: GLM 直接标为不一致, 该项不得分; DeepSeek 同样标为不一致, 只得一半。两个模型在同一处犯了同一个推理错误 —— 逐字比对两份材料看不出这里有没有矛盾, 要理解两种身份各自的含义才能判断。
决策简报要求单列待核事项, GLM 列了 17 项, 却漏掉了和解条件这一整类信息(对方可接受的范围、授权与处置条件); 制度修订建议中, GLM 同样漏列了「推送是否标注数据来源」这一关键未载事实。两处都因关键要求未满足而归零, DeepSeek 在这两个任务上均为满分。
判分方法
评分器随包分发, 判定规则与本页结果使用的完全一致。
关键要求一票否决
评审类: 关键要求只有「通过 / 未通过」两种结果, 不给部分分; 任一未通过, 任务得分归零。次要项堆得再多, 也补不回一条关键错误。
加分项分档加权
评审类: 加分项按「未满足 / 部分满足 / 满足」三档打分, 以重要度为权重加权平均。关键要求全部通过时, 任务得分等于加分项的加权得分。
负面规则
评审类: 专业上不可接受的错误做法单独列为负面规则, 命中即归零; 已被正向判据扣过分的同一问题不重复处罚。
确定性锚点
锚点类: 确定性脚本逐条检查判分锚点, 按权重加权(核心与事实 1.0, 补充 0.5), 同一交付物重复判分结果一致。
两条通过线
锚点类得分 ≥ 0.9 计为通过; 评审类要求满分才计为通过 —— 全部关键要求通过、加分项满分、且未命中负面规则。
判分必须给证据
每条判据的得分都引用交付物中的具体位置与内容; 没有证据不计分。评分器自身故障时不输出分数、单独标记为判分异常, 不会与 0 分混在一起。
结果的适用范围
- 每个模型对每个任务只运行 1 次, 没有重复采样; 结果反映的是一次运行的表现, 不代表稳定性。
- 评审类项目的评分模型与被测模型属于同一家族(GLM 的交付由 GLM 评分, DeepSeek 的交付由 DeepSeek 评分), 无法排除对自家输出的偏好。两个模型在不同项目上互有胜负, 未见一致的偏向。
- 锚点类项目以项目级汇总结果计入。
- 首批样本共 57 个任务、5 个项目, 结果用于说明数据的判别方式与失败形态, 不作为通用能力排名。