中文

LLM 判官得分 inflated:探索相关性评估中的高估现象

信息检索 2026-04-28 v3

摘要

人类相关性评估耗时且需要认知资源,限制了信息检索评估的可扩展性。这导致越来越多的人关注使用大语言模型 (LLM) 作为人类判官的代理。然而,是否已有 LLM 基于的相关性判断可靠、稳定且足以匹配人类进行相关性评估仍是一个未解决的问题。本文我们研究了 LLM 基于的相关性判断中是否存在系统性高估行为,横跨模型架构、评估范式(点评和两两比较)以及 passage 修改策略。我们展示模型始终会对并不真正满足底层信息需求的 passage 分配被高估的相关性得分——这表明是系统性偏差而非随机波动。在控制实验中,我们发现 LLM 基于的相关性判断对 passage 长度和表层词汇线索高度敏感。这些结果引发了关于 LLM 作为人类相关性评估者的替代品的担忧,并突显了在应用 LLM 进行相关性评估时迫切需要谨慎诊断评估框架。我们的代码和结果已公开。

关键词

引用

@article{arxiv.2602.17170,
  title  = {When LLM Judges Inflate Scores: Exploring Overrating in Relevance Assessment},
  author = {Chuting Yu and Hang Li and Guido Zuccon and Joel Mackenzie and Teerapong Leelanupab},
  journal= {arXiv preprint arXiv:2602.17170},
  year   = {2026}
}

备注

Accepted at SIGIR 2026