中文

提出正确的比较:使用LLM评判器的偏差感知贝叶斯主动Top-k排序

机器学习 2026-07-02 v1

摘要

大型语言模型(LLM)越来越多地被用作廉价、可扩展的评判器,成对比较候选输出——用于对响应进行排序、选择模型或筛选论文。然而,LLM评判器既嘈杂又存在系统性偏差:它们偏爱冗长或格式良好的答案,并表现出位置效应,因此简单地聚合它们的投票恢复的是呈现方式的排名,而不是真实质量的排名。我们研究了在固定比较预算下识别\topk{}项的实际目标,并做出了两项贡献。首先,我们将评判视为对潜在质量的贝叶斯推断,并带有显式的、特定于评判器的偏差协变量(冗长性、位置),通过收缩先验进行正则化,以便数据决定给定评判器实际表现出哪些偏差。其次,我们引入了一种\topk感知的主动获取规则,该规则选择下一个比较以最大程度地减少关于\topk{}成员资格的不确定性,而不是关于完整排序的不确定性。在一个已知真实质量的受控基准上,由跨越开放和专有家族的十六个真实LLM(Llama、Qwen、Phi-4、GPT-4o-mini/5.1/5.5、Gemini、DeepSeek和Claude Haiku/Sonnet/Opus)进行评判,朴素聚合在存在偏差的评判器上无论预算如何都会停滞在错误的\topk{}上,而我们的偏差感知模型则能恢复它;\topk感知获取达到这一上限所需的比较次数远少于循环赛或全局不确定性(D-最优)规则。偏差是真实的,但也是异构且依赖于能力的:廉价和中端评判器带有强烈的冗长性偏差,我们的模型纠正了这一点(将召回率从\sim0.50.5--0.60.6提高到0.840.84--1.01.0),而我们测试的前沿评判器几乎没有偏差,并且已经能够准确排序,因此偏差感知建模在那里变化不大。

关键词

引用

@article{arxiv.2607.02104,
  title  = {Ask the Right Comparison:Bias-Aware Bayesian Active Top-$k$ Ranking with LLM Judges},
  author = {Jian Xu and Delu Zeng and John Paisley and Qibin Zhao},
  journal= {arXiv preprint arXiv:2607.02104},
  year   = {2026}
}