与 AI 一起工作 | 9. LLM-as-a-Judge 能不能给 AI 当裁判
与 AI 一起工作 | 9. LLM-as-a-Judge 能不能给 AI 当裁判
让人评价一万条开放式回答,昂贵而缓慢;用关键词、字符串匹配或传统自动指标,又很难判断一段解释是否清楚、完整、切题。
于是,一个自然的办法出现了:让另一个大语言模型阅读任务、候选回答和评分标准,再输出分数、偏好或评语。这就是通常所说的 LLM-as-a-Judge,也就是“让大模型担任评委”。
问题是:一个会犯错、会受提示影响的模型,能不能评价另一个模型?

答案是:可以用,但不能迷信。LLM 评委是一种可扩展的评价工具,不是客观真理来源。 它擅长处理开放式质量判断,却不应替代确定性检查、原始证据和高风险场景中的人工决策。
LLM 评委实际在做什么
一次 LLM 评审至少包含四部分输入:待评价的任务、评价标准、候选回答,以及可选的参考答案或证据。它根据这些内容生成分数、胜负关系、解释或修改建议。
因此,所谓“评委能力”并不是一个脱离环境的固定属性。换一套评分量表、交换候选顺序、删掉参考答案,甚至改变提示中的措辞,结果都可能变化。
更准确的理解是:LLM 评委执行的是一个条件化的判断程序。我们不仅要问“用了哪个模型”,还要问:它看到了什么、按什么标准判断、输出格式是什么、如何处理不确定和分歧。
Pointwise 与 Pairwise:两种常见方式
| 方式 | 做法 | 优点 | 主要风险 |
|---|---|---|---|
| Pointwise 单点评分 | 对每个回答独立打分,例如按准确、完整、清晰等维度给分 | 易形成绝对分数,适合检查单个产物是否达标 | 不同批次尺度可能漂移,7 分和 8 分的边界不稳定 |
| Pairwise 两两比较 | 同时展示两个回答,判断哪个更好或是否平局 | 相对判断通常更直观,适合候选排序 | 容易受展示顺序影响,比较次数会随候选数量增加 |
还有一次比较多个候选的 Listwise 方式,但候选越多,上下文干扰和排序复杂度也越高。实践中不必追求一种方式包办所有任务:质量门禁可以用 Pointwise,候选筛选可以用 Pairwise,关键分歧再交给人工复核。
六类常见偏差和不稳定来源
1. 位置偏差
在两两比较中,评委可能更偏好先出现或后出现的答案。只交换候选顺序,胜负就发生变化,说明结论依赖展示位置,而不完全依赖内容。
2. 冗长偏好
更长的回答看起来信息更多,也更容易呈现完整结构,但长度不等于正确。一个重复、绕远甚至夹杂错误的长答案,可能压过简洁而准确的答案。
3. 表达与权威感偏好
术语丰富、语气自信、格式精致的内容容易获得更高评价。问题在于,事实错误也可以被包装得很专业。评委如果没有原始证据,只能在“像是正确”和“确实正确”之间猜测。
4. 自我偏好
评委可能偏好与自身表达习惯、模型家族或训练偏好更接近的答案。让生成者直接评价自己的产物,也容易把共同盲点带进评分。
5. 量表与提示敏感性
“整体质量如何”和“先检查事实错误,任何关键错误都不得高于 2 分”会得到不同结果。模糊标准让评委自行补齐规则,最终比较的可能不是候选答案,而是评委各自想象的任务。
6. 尺度漂移与过度自信
同一质量的回答在不同批次可能得到不同分数;评委也可能在证据不足时给出非常确定的解释。流畅的评语只能说明模型能够说明自己的选择,不能证明选择正确。
这些问题并不意味着 LLM 评委完全无用。它们意味着:评委也必须被评测,评审流程也必须留下可检查的记录。
一条更可信的评审流水线
这条流程有几个关键点。
第一,确定性检查在前。能用程序、数据库约束、测试或原始来源判断的事项,不必交给语言模型猜。
第二,候选匿名化。尽量移除模型名称、作者身份、品牌和无关元信息,减少权威与自我偏好。
第三,冻结评价量表。先定义维度、权重、硬性失败条件和分数锚点,再开始批量评价。不要看到结果后临时修改标准。
第四,做换序和重复评审。Pairwise 至少交换一次候选顺序;重要任务可用不同随机种子、不同评委或不同提示复核,并报告一致与分歧。
第五,给分歧留出口。不一致不是需要被隐藏的噪声,它可能说明任务标准含糊、候选差异很小,或评委缺少必要证据。
哪些交给规则,哪些交给 LLM
| 评价对象 | 优先方法 | 原因 |
|---|---|---|
| 文件是否存在、程序是否通过测试 | 确定性检查 | 状态可直接读取,不需要语言判断 |
| 数字计算、日期、权限、调用次数 | 程序或结构化规则 | 可以精确复算或审计 |
| 引用是否真实、结论是否有来源 | 原始证据与检索核验 | 评委可能对虚构引用给出流畅解释 |
| 回答是否切题、清楚、有帮助 | LLM 评委 + 量表 | 需要语义和整体表达判断 |
| 两个方案哪一个组织更合理 | Pairwise + 换序复核 | 相对质量适合比较式判断 |
| 医疗、法律、财务或安全决策 | 领域专家与责任人 | 错误代价高,不能把责任外包给模型 |
最稳妥的分工不是“规则或 LLM 二选一”,而是规则负责能确定的事实,LLM 负责开放式质量,人负责高风险判断和争议裁决。
以评价两篇博客为例
假设现在有两篇解释“上下文与记忆区别”的文章。直接问评委“哪篇更好”,评委很可能把篇幅、排版和语气混成一个整体印象。
更可靠的做法是先拆出评价协议:
- 用确定性检查确认两篇文章的链接、引用和术语映射没有明显错误。
- 冻结四个语义维度:概念边界、例子有效性、结构清晰度、行动建议可用性。
- 规定硬性条件:如果把“当前上下文”写成“跨任务永久记忆”,概念边界项不得及格。
- 隐去作者和模型名称,随机决定 A、B 顺序。
- 让评委逐项引用候选中的具体句子,再给出比较结果。
- 交换 A、B 顺序再次评价;若胜负反转,标记为不稳定,不直接宣布赢家。
- 由人检查关键事实和分歧项,决定最终采用或修改哪一篇。
这里,LLM 评委降低了逐篇阅读和归类的成本,却没有取得最终裁决权。它更像一个快速、可复制的初审员,而不是无需监督的终审法官。
评审结果也要可审计
一个只有“8.5 分”的结果几乎不可使用。至少应保存:评审协议版本、候选匿名编号、评价维度、分数或胜负、引用的候选证据、评委的不确定项、换序结果,以及是否经过人工复核。
同样,不应默认要求或保存评委的私有思维链。需要的是与评分相关的简短理由和候选证据定位,让人能够检查“这个分数依据了什么”,而不是把更长的模型解释误当成更强的证明。
使用 LLM 评委前的 30 秒检查
- 这项判断是否真的需要语言理解,还是可以确定性验证?
- 评价维度、分数锚点和硬性失败条件是否已经写清?
- 评委是否拿到了判断事实所需的参考答案或原始证据?
- 候选中的模型名、作者和展示顺序是否会引入偏差?
- Pairwise 是否交换了顺序,重要结果是否重复评审?
- 是否记录了一致性、分歧和不确定项,而不只是平均分?
- 评委的理由能否引用候选中的具体证据?
- 高风险或有争议的结果由谁负责人工复核?
- 是否用一批人工标注样本校准过评委,而不是直接大规模使用?
LLM-as-a-Judge 的真正价值,不是让评价从此不需要人,而是让人把稀缺注意力放到标准设计、证据核验和争议样本上。
可以让 AI 当裁判,但要记住:裁判也有偏差,规则必须先于裁判,重要判决还需要回看录像。
延伸阅读
- Haitao Li 等:LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods,系统梳理了 LLM 评估的功能、方法、应用、元评估与局限。