中文

LLM评估套路:关于LLM评估有效性的视角

信息检索 2026-01-21 v1

摘要

大语言模型(LLM)日益被用于评估信息检索(IR)系统,生成的人类评估员通常进行的相关性判断。近期实证研究表明,LLM-based评估常与人类判断一致,部分研究者认为人类评估员或不再是必需;而另一些研究者则关注判断可靠性、有效性及长期影响。随着IR系统逐步融合LLM生成的信号,评估结果可能产生自我强化,进而导致误导性结论。本文探讨LLM评估器可能误报成功的情形,尤其是当LLM-based判断同时影响系统开发与评估时。我们指出关键风险,包括偏见强化、可重复性挑战以及评估方法论不一致性。为此,本文提出量化负面影响的测试方法、监控措施,以及构建集成LLM判断的可重用测试集合的协作框架。通过提供学术界与产业界的视角,本工作旨确立LLM在IR评估中的原则性使用实践。

关键词

引用

@article{arxiv.2504.19076,
  title  = {LLM-Evaluation Tropes: Perspectives on the Validity of LLM-Evaluations},
  author = {Laura Dietz and Oleg Zendel and Peter Bailey and Charles Clarke and Ellese Cotterill and Jeff Dalton and Faegheh Hasibi and Mark Sanderson and Nick Craswell},
  journal= {arXiv preprint arXiv:2504.19076},
  year   = {2026}
}