中文

LLMJudge: 用于相关性判断的大型语言模型

信息检索 2024-08-20 v1

摘要

LLMJudge 挑战赛是 SIGIR 2024 期间 LLM4Eval 研讨会的一部分。测试集合对于评估信息检索(IR)系统至关重要。搜索系统的评估和调优在很大程度上基于相关性标签,这些标签指示文档是否对特定搜索和用户有用。然而,大规模收集相关性判断成本高昂且资源密集。因此,典型实验依赖第三方标注者,他们可能并不总是产生准确的标注。LLMJudge 挑战赛旨在探索一种替代方法,即使用 LLMs 生成相关性判断。近期研究表明,LLMs 可以为搜索系统生成可靠的相关性判断。然而,目前尚不清楚哪些 LLMs 能达到人类标注者的准确性,哪些提示词最有效,微调的开源 LLMs 与 GPT-4 等闭源 LLMs 相比如何,合成生成的数据是否存在偏差,以及数据泄露是否会影响生成标签的质量。本挑战赛将调查这些问题,收集的数据将作为一个软件包发布,以支持信息检索和搜索中的自动相关性判断研究。

关键词

引用

@article{arxiv.2408.08896,
  title  = {LLMJudge: LLMs for Relevance Judgments},
  author = {Hossein A. Rahmani and Emine Yilmaz and Nick Craswell and Bhaskar Mitra and Paul Thomas and Charles L. A. Clarke and Mohammad Aliannejadi and Clemencia Siro and Guglielmo Faggioli},
  journal= {arXiv preprint arXiv:2408.08896},
  year   = {2024}
}

备注

LLMJudge Challenge Overview, 3 pages