返回文章列表

高经济价值白领类数据生产方法论(GDPval)

孙钰涵发布于2026年9月1日
返回文章列表

高经济价值白领类数据生产方法论(GDPval)

孙钰涵发布于2026年9月1日

GDPval是一套面向真实经济活动的 agent 能力评测与训练数据集。每条任务都对应一项具有实际业务价值的知识工作:模型需要阅读真实业务附件,在主流 agent harness 中调用文档技能完成多步 tool-use,最终产出可直接交付的办公文件——而不是停留在"回答问题"。本说明书介绍GDPval bench数据集的背景、我们的数据生产方法论、当前数据资产的分布情况与背后的专家网络。

一、GDPval 背景:从"考能力"到"考产出"

GDPval 是什么 & 为什么值得关注

GDPval 是 OpenAI 于 2025 年 9 月发布的评测基准,用于衡量 AI 模型能否完成真实世界中具有经济价值的工作任务。它第一次系统性地将模型能力评估与真实世界的经济价值创造直接对齐:任务全部来自对美国 GDP 贡献最大的行业,由平均从业 14 年的行业专家出题,交付物是真实工作中会出现的文档、表格与演示文稿。

GDPval 覆盖 9 个行业、44 个职业、1,320 个任务,专家平均从业 14 年

对模型厂商而言,GDPval 的意义不只是"又一个榜单",而在于它同时改变了评测范式、商业叙事与行业坐标系三件事:

GDPval 同时改变评测范式、商业叙事与 AGI 进展坐标系

官方范式的局限,与我们的破局之道

OpenAI 官方采用真人盲评(GSB)计分:AI 与人类专家各自完成同一任务,行业专家在匿名条件下逐对判断"哪份更好",以胜率作为分数。这一范式以真人评分确立了可信度,但也触达了规模化的天花板:

官方 GSB 盲评流程、三项局限,以及用 Rubric 驱动自动评分的解法

二、我们的数据方法论

数据资产构成:一条任务的"五件套"

大多数数据集的最小单元是一道"题",而GDPval 并不是单一形态的"题目集合"。真实的知识工作也从来不是这样发生的——它有背景材料、有交付标准、有执行过程、有验收结论。所以我们把数据的最小单元定义为一次完整工作的全息记录:任务怎么提出、依据什么材料、专家交付了什么、按什么标准评、模型实际跑出了什么。五类资产装在同一条记录里,完整沉淀 输入 → 评分 → 输出 的数据资产,形成一条可复现、可评分、可训练的任务级执行记录。

一条任务的五件套:任务定义、业务附件、标准答案、评测标准、执行轨迹与打分

同一份数据支撑两条落地主线:

  • ① 提升 harness(Agent 框架)执行能力——以优质trajectory作为监督范本,让模型学会任务拆解、skill路由、失败重试、格式自检等闭环动作;
  • ② 提升模型在office领域的 agent 能力——query + 附件 + rubric + score天然构成一个可反复执行、reward 可自动验证的RL environment,可直接对接 GRPO / PPO 等训练方案,也可对多家模型的trajectory 做 best-of-N筛选,产出SFT / DPO高质量样本

Rubric 评分体系:把专家判断变成可审计的测量

大模型的产出正在从"有标准答案的题"走向真实的专业工作——产出一份分析报告、进行一次合规审计。这类产出没有唯一正确答案,评估随之成为瓶颈:纯人工评审贵、慢、口径因人而异;让模型直接打总分,则存在冗长偏好、位置偏差等系统性偏差。Rubric 是对这个问题的第一性回答:把"什么是好"的专家判断,分解为一组原子、可观察、可独立复核的判定标准,让主观质量变成可审计的测量。

传统评分在明确性、结构性、可分解性与可核验性上的痛点,以及 Rubric 的对应解法

在此基础上,我们通过"3 类 × 5 维 × 3 档"的评分机制,确保单条得分的可复现性,再通过合理聚合确保整套 Rubric 得分的公平性。每条评分项的标准被三个标签唯一确定:

Rubric 三层设计:原子层由 3 类 × 5 维 × 3 档唯一确定,再经组织与聚合得到最终分数

① 怎么评 —— 3 类计分类型

评分标准最怕的是"同一条规则,两种判法"。要让机器可执行、让任何人复判都得出同一结果,每条评分项从诞生起就不能有第二条路可走:是致命项还是扣分项,是达成与否的二元判断还是存在中间状态的多档评级——归类和细分都由触发条件决定,而非评审者的临场裁量。取值与计分路径被唯一锁定,才是判分可复现的真正前提。

三类互斥完备的计分类型:一票否决、减分项、加分项,以及加分项的二元与多档细分

② 评什么 —— 跨行业通用的 5 维评价体系

GDPval 任务横跨 20+ 行业、100+ 职业,领域知识千差万别。如果评价框架不通用、不统一,会导致跨任务分数不可比、产线无法规模化。因此我们结合行业前沿论文中验证的方法论,设计了只用任务词、不含专业名词的五维体系——天然跨行业通用,且相互间不重不漏

五维评价体系:结果正确性、专业度、指令遵循、格式、风格/语气及其权重与论文支撑

③ 重要性 —— 3 档优先级乘数

"核心结论正确"与"格式无误"显然不该同权;而格式、语气类增强项恰恰最容易越写越多,会稀释核心要求的分量。因此在维度系数之上,我们的每条评分项还配有条目级的优先级乘数,通过明确的语言定义 + 固定乘数,把专家判断转换为可复现的分数

三档优先级乘数:关键 ×2.0、重要 ×1.0、锦上添花 ×0.4,及其对加分、减分和一票否决项的作用

三档乘数对三类评分项的作用各不相同:

  • 加分项由"维度系数 × 优先级乘数"决定正向得分权重,按分量瓜分 100 分;
  • 减分项由乘数决定扣分幅度,但不进入归一化分母、不稀释正向项权重;
  • 一票否决项不受乘数影响——一旦触发,总分直接清零

由此,每条评分项的标准被唯一确定,再经组织与聚合,得到最终合理且公平的分值

数据产线:生产 → 审核 → 交付三段闭环

从需求沟通与立项开始,每条数据都经过机审 100% 覆盖、两级人审层层把关的三段式闭环。生产段完成产线设计、专家入项与两阶段数据提交;审核段以预检、两级"机审 + 人审"与人工复核层层过滤;交付段完成产物跑分、抽检、打包与入库治理:

数据产线三段闭环:生产段、审核段与交付段

三、数据集概览与分布

核心数据规模

评价训练数据集的价值,任务条数仅为基础指标,单条数据的信息密度具有同等甚至更高的权重。一千余条任务若仅为问答对,其训练价值有限;而当每条任务平均携带一个以上、篇幅达数页的真实业务附件,配备二十至三十五条经多轮审核的评价指标,且全部打分结果严格可复现时,同等规模所承载的训练信号密度将显著提升。规模、密度与可复现性三项指标共同构成该数据集的实际体量。

数据集规模:1000+ 任务、8 大行业、50+ 职业,以及行业覆盖、Rubric 质量与附件特征

专家筛选流程与专家池画像

数据质量的上限由出题专家的真实能力决定。鉴于简历与头衔均可修饰,我们的筛选体系以实操验证为核心:面试环节追问真实项目细节,笔试环节以统一题库划定领域知识分数线,随后以一道已有标准答案的真实生产任务检验产出质量与规范遵循,最终进入小批量真实生产试运行,产出经双人复核、稳定达标后方可转正。五关筛选的目标不是识别"具备行业知识的人",而是筛出"能够按生产标准交付该行业工作的人"。

专家五关筛选流程,以及学历、年限与职业覆盖等专家池画像

技能分布

任务难度由领域知识与执行链路长度共同决定。单技能任务仅要求模型正确完成一类文档操作;技能一经串联,前序步骤的输出即成为后续步骤的输入,任何一次调用失败、参数错位或格式偏移都会沿链路传导至最终交付物,失败面随技能数量叠加而扩大。因此,技能组合的分布实质上反映了数据集的难度梯度分布:多技能任务占比越高,对模型的任务规划、技能路由与格式自检能力的检验越充分。

技能组合分布:单技能 24.8%、双技能 33.4%、三技能及以上 41.8%

性能概览

4 款前沿模型在该测试集上的 Pass Rate 集中于 32%–43% 区间,整体通过率偏低(最高为 Opus 4.8 的 43.1%)。这一现象揭示了当前大模型的能力边界:在要求产出真实可交付文件的复杂 Agent 工作流里,模型在"理解任务"与"最终交付"之间仍存在巨大鸿沟,特别是长链路任务上,对复杂 query 的拆解规划与 skill 精准调度仍不稳定。值得注意的是,Opus 4.8GPT 5.5Qwen 3.8 MaxKimi K3 之间的分差不足 8 个百分点——头部模型在 multi-step 真实业务场景下已触及相似的性能瓶颈,学术基准上的领先优势并未等比转化为真实交付能力。而不足半数的通过率则共同说明:随着业务约束叠加与工具调用链路拉长,多条件推理与细粒度控制的不足会被急剧放大,出现"某一步骤失控 / 工具调用失败 → 整个交付物不及格"的短板效应;排名的差距,更多体现为长链路下执行稳定性的差距,而非单点能力的差距。这恰恰也是该数据集作为训练信号的价值——打出来的不是一个"模型水平分",而是一张"能力短板地图",可以直接映射回哪类 skill、哪种 harness 动作、哪类业务约束需要优先训练。

四款前沿模型在 GDPval 上的通过率:Opus 4.8 为 43.1%,其余集中在 31.6%–36.8%

分数口径说明:上图"分数 / 通过率"均指Pass Rate(全局通过率)。单任务打分口径:LLM-as-a-Judge 按 rubric 逐条判定并隐性聚合出 0–100 分,单任务综合得分 ≥ 60 即视为该任务 pass;模型在整个测试集上的最终得分 = pass 任务数 / 总任务数,即全局通过率。因此本节所有百分数均为通过率而非平均 rubric score(例如 40% 代表模型在全部任务中有 40% 被判定为 pass)

GDPval是一套面向真实经济活动的 agent 能力评测与训练数据集。每条任务都对应一项具有实际业务价值的知识工作:模型需要阅读真实业务附件,在主流 agent harness 中调用文档技能完成多步 tool-use,最终产出可直接交付的办公文件——而不是停留在"回答问题"。本说明书介绍GDPval bench数据集的背景、我们的数据生产方法论、当前数据资产的分布情况与背后的专家网络。

一、GDPval 背景:从"考能力"到"考产出"

GDPval 是什么 & 为什么值得关注

GDPval 是 OpenAI 于 2025 年 9 月发布的评测基准,用于衡量 AI 模型能否完成真实世界中具有经济价值的工作任务。它第一次系统性地将模型能力评估与真实世界的经济价值创造直接对齐:任务全部来自对美国 GDP 贡献最大的行业,由平均从业 14 年的行业专家出题,交付物是真实工作中会出现的文档、表格与演示文稿。

GDPval 覆盖 9 个行业、44 个职业、1,320 个任务,专家平均从业 14 年

对模型厂商而言,GDPval 的意义不只是"又一个榜单",而在于它同时改变了评测范式、商业叙事与行业坐标系三件事:

GDPval 同时改变评测范式、商业叙事与 AGI 进展坐标系

官方范式的局限,与我们的破局之道

OpenAI 官方采用真人盲评(GSB)计分:AI 与人类专家各自完成同一任务,行业专家在匿名条件下逐对判断"哪份更好",以胜率作为分数。这一范式以真人评分确立了可信度,但也触达了规模化的天花板:

官方 GSB 盲评流程、三项局限,以及用 Rubric 驱动自动评分的解法

二、我们的数据方法论

数据资产构成:一条任务的"五件套"

大多数数据集的最小单元是一道"题",而GDPval 并不是单一形态的"题目集合"。真实的知识工作也从来不是这样发生的——它有背景材料、有交付标准、有执行过程、有验收结论。所以我们把数据的最小单元定义为一次完整工作的全息记录:任务怎么提出、依据什么材料、专家交付了什么、按什么标准评、模型实际跑出了什么。五类资产装在同一条记录里,完整沉淀 输入 → 评分 → 输出 的数据资产,形成一条可复现、可评分、可训练的任务级执行记录。

一条任务的五件套:任务定义、业务附件、标准答案、评测标准、执行轨迹与打分

同一份数据支撑两条落地主线:

  • ① 提升 harness(Agent 框架)执行能力——以优质trajectory作为监督范本,让模型学会任务拆解、skill路由、失败重试、格式自检等闭环动作;
  • ② 提升模型在office领域的 agent 能力——query + 附件 + rubric + score天然构成一个可反复执行、reward 可自动验证的RL environment,可直接对接 GRPO / PPO 等训练方案,也可对多家模型的trajectory 做 best-of-N筛选,产出SFT / DPO高质量样本

Rubric 评分体系:把专家判断变成可审计的测量

大模型的产出正在从"有标准答案的题"走向真实的专业工作——产出一份分析报告、进行一次合规审计。这类产出没有唯一正确答案,评估随之成为瓶颈:纯人工评审贵、慢、口径因人而异;让模型直接打总分,则存在冗长偏好、位置偏差等系统性偏差。Rubric 是对这个问题的第一性回答:把"什么是好"的专家判断,分解为一组原子、可观察、可独立复核的判定标准,让主观质量变成可审计的测量。

传统评分在明确性、结构性、可分解性与可核验性上的痛点,以及 Rubric 的对应解法

在此基础上,我们通过"3 类 × 5 维 × 3 档"的评分机制,确保单条得分的可复现性,再通过合理聚合确保整套 Rubric 得分的公平性。每条评分项的标准被三个标签唯一确定:

Rubric 三层设计:原子层由 3 类 × 5 维 × 3 档唯一确定,再经组织与聚合得到最终分数

① 怎么评 —— 3 类计分类型

评分标准最怕的是"同一条规则,两种判法"。要让机器可执行、让任何人复判都得出同一结果,每条评分项从诞生起就不能有第二条路可走:是致命项还是扣分项,是达成与否的二元判断还是存在中间状态的多档评级——归类和细分都由触发条件决定,而非评审者的临场裁量。取值与计分路径被唯一锁定,才是判分可复现的真正前提。

三类互斥完备的计分类型:一票否决、减分项、加分项,以及加分项的二元与多档细分

② 评什么 —— 跨行业通用的 5 维评价体系

GDPval 任务横跨 20+ 行业、100+ 职业,领域知识千差万别。如果评价框架不通用、不统一,会导致跨任务分数不可比、产线无法规模化。因此我们结合行业前沿论文中验证的方法论,设计了只用任务词、不含专业名词的五维体系——天然跨行业通用,且相互间不重不漏

五维评价体系:结果正确性、专业度、指令遵循、格式、风格/语气及其权重与论文支撑

③ 重要性 —— 3 档优先级乘数

"核心结论正确"与"格式无误"显然不该同权;而格式、语气类增强项恰恰最容易越写越多,会稀释核心要求的分量。因此在维度系数之上,我们的每条评分项还配有条目级的优先级乘数,通过明确的语言定义 + 固定乘数,把专家判断转换为可复现的分数

三档优先级乘数:关键 ×2.0、重要 ×1.0、锦上添花 ×0.4,及其对加分、减分和一票否决项的作用

三档乘数对三类评分项的作用各不相同:

  • 加分项由"维度系数 × 优先级乘数"决定正向得分权重,按分量瓜分 100 分;
  • 减分项由乘数决定扣分幅度,但不进入归一化分母、不稀释正向项权重;
  • 一票否决项不受乘数影响——一旦触发,总分直接清零

由此,每条评分项的标准被唯一确定,再经组织与聚合,得到最终合理且公平的分值

数据产线:生产 → 审核 → 交付三段闭环

从需求沟通与立项开始,每条数据都经过机审 100% 覆盖、两级人审层层把关的三段式闭环。生产段完成产线设计、专家入项与两阶段数据提交;审核段以预检、两级"机审 + 人审"与人工复核层层过滤;交付段完成产物跑分、抽检、打包与入库治理:

数据产线三段闭环:生产段、审核段与交付段

三、数据集概览与分布

核心数据规模

评价训练数据集的价值,任务条数仅为基础指标,单条数据的信息密度具有同等甚至更高的权重。一千余条任务若仅为问答对,其训练价值有限;而当每条任务平均携带一个以上、篇幅达数页的真实业务附件,配备二十至三十五条经多轮审核的评价指标,且全部打分结果严格可复现时,同等规模所承载的训练信号密度将显著提升。规模、密度与可复现性三项指标共同构成该数据集的实际体量。

数据集规模:1000+ 任务、8 大行业、50+ 职业,以及行业覆盖、Rubric 质量与附件特征

专家筛选流程与专家池画像

数据质量的上限由出题专家的真实能力决定。鉴于简历与头衔均可修饰,我们的筛选体系以实操验证为核心:面试环节追问真实项目细节,笔试环节以统一题库划定领域知识分数线,随后以一道已有标准答案的真实生产任务检验产出质量与规范遵循,最终进入小批量真实生产试运行,产出经双人复核、稳定达标后方可转正。五关筛选的目标不是识别"具备行业知识的人",而是筛出"能够按生产标准交付该行业工作的人"。

专家五关筛选流程,以及学历、年限与职业覆盖等专家池画像

技能分布

任务难度由领域知识与执行链路长度共同决定。单技能任务仅要求模型正确完成一类文档操作;技能一经串联,前序步骤的输出即成为后续步骤的输入,任何一次调用失败、参数错位或格式偏移都会沿链路传导至最终交付物,失败面随技能数量叠加而扩大。因此,技能组合的分布实质上反映了数据集的难度梯度分布:多技能任务占比越高,对模型的任务规划、技能路由与格式自检能力的检验越充分。

技能组合分布:单技能 24.8%、双技能 33.4%、三技能及以上 41.8%

性能概览

4 款前沿模型在该测试集上的 Pass Rate 集中于 32%–43% 区间,整体通过率偏低(最高为 Opus 4.8 的 43.1%)。这一现象揭示了当前大模型的能力边界:在要求产出真实可交付文件的复杂 Agent 工作流里,模型在"理解任务"与"最终交付"之间仍存在巨大鸿沟,特别是长链路任务上,对复杂 query 的拆解规划与 skill 精准调度仍不稳定。值得注意的是,Opus 4.8GPT 5.5Qwen 3.8 MaxKimi K3 之间的分差不足 8 个百分点——头部模型在 multi-step 真实业务场景下已触及相似的性能瓶颈,学术基准上的领先优势并未等比转化为真实交付能力。而不足半数的通过率则共同说明:随着业务约束叠加与工具调用链路拉长,多条件推理与细粒度控制的不足会被急剧放大,出现"某一步骤失控 / 工具调用失败 → 整个交付物不及格"的短板效应;排名的差距,更多体现为长链路下执行稳定性的差距,而非单点能力的差距。这恰恰也是该数据集作为训练信号的价值——打出来的不是一个"模型水平分",而是一张"能力短板地图",可以直接映射回哪类 skill、哪种 harness 动作、哪类业务约束需要优先训练。

四款前沿模型在 GDPval 上的通过率:Opus 4.8 为 43.1%,其余集中在 31.6%–36.8%

分数口径说明:上图"分数 / 通过率"均指Pass Rate(全局通过率)。单任务打分口径:LLM-as-a-Judge 按 rubric 逐条判定并隐性聚合出 0–100 分,单任务综合得分 ≥ 60 即视为该任务 pass;模型在整个测试集上的最终得分 = pass 任务数 / 总任务数,即全局通过率。因此本节所有百分数均为通过率而非平均 rubric score(例如 40% 代表模型在全部任务中有 40% 被判定为 pass)

返回

更多博客