中文

通过偏置有界评估实现可证明无偏的大语言模型评判器

人工智能 2026-03-06 v1

摘要

随着 AI 模型从简单的聊天机器人发展到更复杂的工作流程,我们正逼近一个临界点,在此之后 AI 系统将被用于自主、自维护的反馈回路中。任何自主 AI 系统都依赖于自动、可验证的奖励和反馈;在 ground truth 稀缺或非确定性的场景中,实际可行的奖励来源之一是以大语言模型为评判器的系统。尽管 LLM 评判器不断改进,但文献中尚未提出能够在偏置向量未知或受对手发现时强制执行标准的系统。为此,我们提出了平均偏置有界性 (A-BB),一种算法框架,形式上保证任何可测量的 LLM 评判器偏置的结果在有害/影响方面实现减少。我们在 Arena-Hard-Auto 上进行评估,使用四个 LLM 评判器,在 (tau=0.5, delta=0.01) 的偏置有界性保证下,保持了 61-99% 的原始排名相关性,涵盖格式和结构偏置场景,其中大多数评判器-偏置组合均超过 80%。我们的代码可在 https://github.com/penfever/bias-bounded-evaluation 获取。

关键词

引用

@article{arxiv.2603.05485,
  title  = {Towards Provably Unbiased LLM Judges via Bias-Bounded Evaluation},
  author = {Benjamin Feuer and Lucas Rosenblatt and Oussama Elachqar},
  journal= {arXiv preprint arXiv:2603.05485},
  year   = {2026}
}