为「真实专家工作」而建的
Agent 评测数据
这些任务来自各行业专业人士的真实工作场景 —— 工业固件算法、机器视觉检测、游戏引擎、量化策略、专业内容运营。难度不来自人为构造, 而来自真实工作本身的复杂性; 每道任务都配有可执行的验证资产与逐条判据。
真实场景专家级难度双重验证全程可溯源
8任务 / 样本集
4行业方向
15.9平均每任务验收判据
21平均每任务工作区文件
约 13%候选任务达到发布条件
§ 1
数据的四个特点
每一条都对应一道可核查的质量机制, 而非口号。
01
真实专家任务
源自各行业专业人士的真实工作场景, 非合成、非改编谜题; 任务的难度与信息缺口如实保留, 贴近真实生产中的判断与取舍。
02
双重验证
行为类任务在判卷方世界模型下可执行判分; 产物类任务采用专家级逐条判据与双模型评审。参考解必须满分、零操作必须零分、劣化解必须低于及格线。
03
阈值独立校准
数值类判据的阈值以独立第二实现与近失消融标定 —— 把「差一点」的解与真正的解分开, 不依赖单一参考。
04
全程可溯源
每道任务附完整元数据(来源、验证方式、质检记录、污染标记)与逐文件哈希, 每个质量声称都可核查。
获取完整样本进行评估样本集附完整验证资产与评分协议, 可在本机或容器内复现全部判分
申请样本