中文

任意大语言模型都可成为可靠评判家:基于推理的偏见检测去偏

计算与语言 2025-10-29 v2

摘要

LLM-as-a-Judge 已成为一种有前景的工具,用于自动评估生成输出,但其可靠性常因潜在偏见而受到制约。现有方法为了缓解这些偏见面临关键局限:基于情境学习的方法未能解决源于评估器自我反思能力有限的根本性偏见,而微调对所有评估器类型尤其是闭源模型不可行。为此,我们引入基于推理的偏见检测器(Reasoning-based Bias Detector, RBD),其为一个可插拔模块,识别有偏见的评估并生成结构化推理,以指导评估器自我纠正。RBD 不修改评估器本身,而是外部操作,通过迭代的偏见检测和反馈驱动的修订过程工作。为支持其开发,我们设计了完整的管道,包括有偏见数据集构建、监督信息收集、RBD 的基于推理的微调,以及与 LLM 评估器的集成。我们对四种规模的 RBD 模型进行微调,规模从 1.5B 到 14B 不等,观察到所有规模上均表现出一致的性能提升。在 4 种偏见类型(verbosity(冗长度)、position(位置)、bandwagon(从众)和 sentiment(情感))上,使用 8 个 LLM 评估器进行评估,结果显示 RBD 具有强大的有效性。例如,RBD-8B 模型在评估准确率提升平均 18.5%,在一致性提升 10.9%,并超越基于提示的基线和微调评判 12.8% 和 17.2%。这些结果凸显了 RBD 的有效性和可扩展性。额外实验进一步表明其在偏见和领域上的强大泛化能力,以及其效率。

关键词

引用

@article{arxiv.2505.17100,
  title  = {Any Large Language Model Can Be a Reliable Judge: Debiasing with a Reasoning-based Bias Detector},
  author = {Haoyan Yang and Runxue Bao and Cao Xiao and Jun Ma and Parminder Bhatia and Shangqian Gao and Taha Kass-Hout},
  journal= {arXiv preprint arXiv:2505.17100},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025 (Camera-Ready Version)