中文

评判评判者:LLM 生成的相关性判断集合

信息检索 2025-02-20 v1

摘要

使用大型语言模型 (LLMs) 进行相关性评估为改进信息检索 (IR)、自然语言处理 (NLP) 及相关领域提供了有前景的机遇。确实,LLMs 有望使 IR 实验者以目前所需人工劳动的一小部分来构建评估集合。这可以帮助应对知识仍然有限的新主题,并缓解在低资源场景下评估排序系统的挑战,因为在这些场景中很难找到人工标注者。鉴于该领域近期快速发展,关于 LLMs 作为评估者的许多问题仍有待回答。在需要进一步研究的方面中,我们可以列出相关性判断生成流水线中各个组件的影响,例如所使用的提示或所选的 LLM。本文对大规模自动相关性判断评估(SIGIR 2024 的 LLMJudge 挑战赛)的结果进行了基准测试与报告,该挑战赛中提出了不同的相关性评估方法。具体而言,我们发布并对参与该挑战赛的八支国际团队生成的 TREC 2023 深度学习赛道相关性判断的 42 个 LLM 生成标签进行了基准测试。鉴于其多样性,这些自动生成的相关性判断不仅可以帮助社区调查由 LLMs 引起的系统性偏差,还可以探索集成模型的有效性,分析不同模型与人工评估者之间的权衡,并推进改进自动评估技术的方法论。发布的资源可在以下链接获取:https://llm4eval.github.io/LLMJudge-benchmark/

关键词

引用

@article{arxiv.2502.13908,
  title  = {Judging the Judges: A Collection of LLM-Generated Relevance Judgements},
  author = {Hossein A. Rahmani and Clemencia Siro and Mohammad Aliannejadi and Nick Craswell and Charles L. A. Clarke and Guglielmo Faggioli and Bhaskar Mitra and Paul Thomas and Emine Yilmaz},
  journal= {arXiv preprint arXiv:2502.13908},
  year   = {2025}
}

备注

11 pages