模型开始接手报告、分析、设计和研究,评估也随之改变。很多结果不再适合用一段脚本核对,人们转而把“什么算好”写进自然语言 Rubric,再让另一个 Agent 完成判断。
问题在于,语言变成了评估接口,不代表质量标准已经存在。把几句话列成清单很容易,把真实工作中的专业判断完整地写进去却很难。
今天被广泛使用的 Rubric,正在获得超过其质量的权力。我们讨论得太多的是模型有没有遵守标准,讨论得太少的是:这些标准究竟配不配评价模型。
自动生成 Rubric,是在逃避真实标准
模型生成答案时,经常有两个倾向:
- 不愿承认信息不足
- 为了显得完整而自行补齐前提
用模型生成 Rubric ,这两个倾向被放大到评分环节。如果不经过纠正,这种偏好会逐渐自洽且远离真实标准。
RubricBench[1] 收录的一道储蓄题,暴露了这种缺陷。用户问“12 万存 30 年,最后会有多少储蓄”,却没有给出更多需要用于决策的信息,如币种、利率等。面对这些缺口,一个好的回答首先要主动获取这些信息。[2]
先看三组标准
左侧是 RubricBench 的人工参考标准;中间是 OpenRubric 生成的硬约束与核心任务;右侧是它继续自动优化补写后的版本。
人工标准把“知道何时不能直接作答”视为质量的一部分:先指出缺失变量,主动追问,或者给出前提清楚的多个情景。它没有要求回答必须交出一个数字。
自动生成的标准却做了相反的选择,在优化中逐渐加码边界情况与无限兜底,却始终没有指出核心评分标准。
Judge 最终选择了 B
到这里,再看两个回答。
Response A 先追问信息。Response B 自行假设年利率为 3%、按年复利,并声称 30 年后会得到 336,960.71。这个数字也是错的:正确结果约为 $291,271.50。
OpenRubric 的 Judge 明确识别出 B 的数学错误,却仍然判 B 获胜。它给出的理由是:B 满足了全部硬约束,并按照 Rubric 的要求自行作出了“合理假设”;A 没有提供数字,因此三条硬约束全部失败,还触发了“含糊”风险。[3]
当这份 Rubric 被交给 Judge,甚至用于训练模型时,它奖励的就不再是更可靠的判断,而是更好好先生、表面上更完整的答案。
这种偏差不会随着模型变强自动消失。我们把同一个问题交给 GPT-5.6-sol,它没有再武断地选定 3%,而是从 0% 一路算到 10%,列出了八种收益情景。
这份回答会算复利,数字也基本正确,却仍不像理财专家会做的行为。专家不会把一张收益率表当作服务的终点,而会先弄清用户说的“存”究竟是存款、理财还是长期投资,这笔钱何时要用,以及用户能承受多大波动,再据此缩小可讨论的收益范围。
GPT-5.6-sol 有完成这些判断所需的知识,却被评价偏好推向了更容易得分的动作:列满场景,显得周全。
这才是 Rubric 偏离真实标准更麻烦的后果。模型缺的未必是专业知识,而是像专业人士一样选择下一步的能力。如果无法像专业人士一样给出评价标准,模型就无法像专业人士一样行动。
所谓专业性判断,很多时候只是看起来专业
专业需要锚点,而不是堆砌专业词汇
真正的锚点会告诉评审去看什么、边界在哪里、失败意味着什么。“专业”“全面”“有洞察”做不到这些。它们更像一句期待,而不是一个可执行的标准。
OpenAI 的 GDPval[4] 其中一题要求模型为 Texas 客户起草遗嘱。下面两条都来自这道题的 67 条 Rubric;整套标准合计 140 分。[5]
第一条给出了明确的人物和法律角色。第二条只说“像一份专业法律文件”,没有说明字体、版式或层级的边界。
这不说明遗嘱专家不知道专业法律文件应该是什么样;这份 Rubric 的其他条目也规定了部分标题、见证、公证和签名要求。问题在于“整体专业风格”这条标准仍没有给出客观且明确的判断边界。对资深专家来说,职业规范可能补足这种认知经验;交给自动 Judge 后,补足方式取决于模型先验及其可见的参考上下文,而不是这条 Rubric 本身。
这句话也不是偶然出现的标准。我们逐条检索了 GDPval 数据[6]:220 个任务中,140 个直接使用 Overall formatting and style of the deliverable,覆盖 44 个职业中的 42 个,且这一项一律计 5 分。律师、护士、审计师、工程师和音乐制作人的“整体格式与风格”,都由几乎相同的一句话来评分。
Rubric 需要把适用条件、可观察证据和失败后果写出来,而且这些门槛必须来自任务或获授权的专业规范,不能由一句“需要像一个专业人士”搪塞过去。
值得一提的是,OpenAI 也明确表示,自动 grader 尚不足以取代专家,而GDPVal本身也采用和人类专家pairwise的方式来做评估,开源的Rubrics也只提供辅助判断的价值,而很多lab却将其奉为金科玉律。
Yes/No 能检查约束,但无法代表专业质量
GDPval 中有一项音乐制作任务:为歌手制作一首约 2 分 17 秒的伴奏,供录音工程师直接使用。Prompt 对成品的创作要求和部分Rubric如下。[7]
这份 Rubric 共 35 条、62 分。它还检查调性、桥段、效果器和乐器配置;我们逐条核对后,没有一项直接评价 bossa、bright、punchy、high-energy 和 groove 这些审美目标完成到了什么程度。它能判断技术交付和部分编曲要求是否合规,却不能直接判断这是不是客户想要的声音。
bright、punchy、bossa-influenced 不能由几个Yes/No 选项来承载其复杂度。如果要把这类判断交给自动 Judge,专家就需要结合客户 brief 和参考音频,说明哪些可听见的特征支持区分在这些方面的好坏与分级,再提供样例、反例和完成度档位。把模糊的创作要求澄清为可复核标准,正是专家不可省略的工作。
Yes/No 很可靠,它负责守住明确底线;而锚点与客观分级标准应该负责区分质量,告诉 Judge 应该看什么、差距有多大。
权重的缺失与滥用
Rubric 并不是等长的。一条可能只检查有没有标题,另一条却装着十个事实和真正决定交付质量的专业判断。把它们各记一票,看起来公平,其实把差距抹平了。
20% 的 Rubric,代表 100% 的专业差距
Meta 的 AdvancedIF[8] 公开了 1,645 个任务和 12,442 条专家编写的 Rubric,每题有 1–20 条。官方工具除了报告“全部 Rubric 都通过”的任务比例,还报告一项 micro-level pass rate:通过的 Rubric 数,除以全部 Rubric 数。[9]
在这个 micro 口径里,一条 Rubric 就是一张票。
其中一题要求模型列出五种最致命癌症及其五年生存率,再列出五种罕见癌症及其美国年病例数;两个列表不得重合,还要分别排序、调整先后、增加开场、排除胰腺癌,并且不加标题。[10]
这道题有九条 Rubric。前两条检查十种癌症及其生存率或年病例数,合计约 20 个事实字段。后七条检查去重、排序、列表先后、开场、排除胰腺癌和标题。
标题是否存在是一张票,十个医学事实捆在一起也是一张票。一个回答可以满足七项选择与格式要求,把两组核心事实全部答错,rubric-level pass rate 仍然有 77.8%。
分数说“大部分要求已经通过”,专家看到的却是一份不能相信的医学回答。真正拉开专业差距的内容集中在少数 Rubric 里,容易满足的指令和格式却拿走了 7/9 的票。
没有权重列,权重也不会消失。越容易写成 Yes/No 的格式要求,越容易被拆成多条;越难写清楚的专业判断,越可能被塞进一条。最后,条目数量替评估者完成了最重要的价值分配。
未经设计的权重依然无法有效工作
把分值写进 Rubric,看上去解决了这个问题:核心内容终于可以比格式要求更重要。但如何保证权重的合理性成为了下一个需要解决的问题。
GDPval 为每条公开 Rubric 设置了分值。其中一题要求新任主管制作一份 8–10 页的演示,说服长期反对外部合作的咨询委员会,把县商会作为第一个合作伙伴。这道题有 17 条 Rubric,正向分值合计 54 分。[11]
文件能够打开,得到 10 分,占全部正向分值的 18.5%。回应持反对态度的委员会并给出缓解方案,只有 1 分,占 1.9%。再加上“整体格式与风格”的 5 分,文件与包装一共拿走 15/54,也就是 27.8%。
问题不只出在这一题。我们逐条检查了 GDPval 数据[6]中的 220 个开放任务。10,453 条标准的分值从 −85 到 +20;18 个任务含负分,17 个任务出现高于 +5 的分值。公开字段记录了 score 和 criterion,却没有解释一条标准为什么值 1、5、10 或 −85 分。
同样一句 Overall formatting and style,在 140/220 个任务中固定得到 5 分。因为每道题的总分不同,这 5 分的实际占比从 2.76% 到 21.74%,相差 7.87 倍。
另有 7 个任务包含同题重复标准;其中一个任务[12]把“PDF 最后一页包含完整成本分析截图”写了两遍、各计 2 分。重复后的 4 分,正好等于“不超 3000 美元预算”和“合计算术正确”两项之和。
权重应该从失败后果出发。文件能否打开适合做门槛;说服是否成立才需要区分完成度;同一个错误被拆成两条,也不能再获得一次奖励。确定这些边界之后,还需要比较同级目标的相对重要性。
OpenAI 的 PaperBench[13]提供了一种更可解释的做法:先建立层级,只在同级目标之间分配相对权重,最后逐层向上聚合。底层为了方便判断而多拆几条,也不会增加这一支在总分中的份额。
What's Next?
知道什么样的 Rubric 会失效,还不等于知道标准从哪里来。
下一篇,我们会讨论如何把任务要求、上下文环境和专家判断编译成一份可追溯的 Rubric,而不是让模型只凭空生成。