面向可靠 LLM 判评器:判别偏差评估与去偏优化
计算与语言
2026-03-10 v1
摘要
大型语言模型(LLM)判评器广泛用于自动评估和奖励建模,但其判决常受到判别偏差的影响。准确评估这些偏差对于确保 LLM 判评器的可靠性至关重要。然而,现有研究通常仅在单一判评方案(生成式或判别式)下探讨有限的偏差,缺乏全面的评估。为弥合这一差距,我们提出了 JudgeBiasBench,一个系统性量化 LLM 判评器偏差的基准。JudgeBiasBench 定义了跨 4 个维度的判别偏差分类,并通过受控偏差注入管道构建偏差增强的评估实例,覆盖 12 种具代表性的偏差类型。我们在生成式和判别式判评器上开展了大量实验,揭示当前判评器呈现出显著且多样的偏差模式,常常损害自动评估的可靠性。为缓解判别偏差,我们提出了一种认识偏差的训练方法,明确将偏差相关属性纳入训练过程,鼓励判评器分离与任务相关的质量与偏差关联线索。通过对生成式判评器采用强化学习,对判别式判评器采用对比学习,我们的方法有效减少了判别偏差,同时基本保持了一般评估能力。
关键词
引用
@article{arxiv.2603.08091,
title = {Toward Robust LLM-Based Judges: Taxonomic Bias Evaluation and Debiasing Optimization},
author = {Hongli Zhou and Hui Huang and Rui Zhang and Kehai Chen and Bing Xu and Conghui Zhu and Tiejun Zhao and Muyun Yang},
journal= {arXiv preprint arXiv:2603.08091},
year = {2026}
}