UDA:面向成对 LLM-as-a-Judge 的无监督去偏对齐
人工智能
2025-11-18 v2
摘要
大型语言模型(LLM)的成对评估是一种常见范式,但它容易受到偏好偏差的影响,即评判者系统性地偏爱某些输出,例如它们自己的输出。这种偏差导致不同评判者之间的排名不一致且偏斜。为了解决这个问题,我们首先通过实验证明了跨模型评估中存在显著且异质的偏差。然后,我们提出了 UDA(无监督去偏对齐),这是一个通过动态调整 Elo 评分系统来减少评判者间分歧的框架。对于每一次成对比较,一个紧凑的神经网络学习自适应地设置 K 因子并细化获胜概率。至关重要的是,UDA 以完全无监督的方式运行,仅以最小化所有评判者 Elo 轨迹间的离散度为引导目标。这迫使向集体共识对齐,该共识作为一个更稳定、可复现评估的无监督代理。此外,我们提供了理论动机,证明向共识对齐如何能减少聚合系统偏差。实验表明,UDA 显著地将评判者间评分标准差降低了高达 63.4%,并将与人类判断的平均相关性提高了 24.7%。值得注意的是,UDA 将表现不佳的评判者的性能提升至与高质量评判者相当的水平,从而培育了一个更健壮、更可靠的评估生态系统。代码和数据可在 https://anonymous.4open.science/r/62AB93CD-23B4 获取。
引用
@article{arxiv.2508.09724,
title = {UDA: Unsupervised Debiasing Alignment for Pair-wise LLM-as-a-Judge},
author = {Yang Zhang and Cunxiang Wang and Lindong Wu and Wenbo Yu and Yidong Wang and Guangsheng Bao and Jie Tang},
journal= {arXiv preprint arXiv:2508.09724},
year = {2025}
}