中文

利用TREC播客赛道重新审视人类与LLM的判断

信息检索 2026-01-15 v2

摘要

使用大语言模型(LLM)来标注相关性是信息检索领域一项日益重要的技术。虽然一些研究表明LLM可以与真实(人类)判断达到很高的用户一致性,但其他研究则得出了相反的结论。据我们所知,这些研究主要集中在经典的即席文本搜索场景。在本文中,我们对LLM与人类专家之间的用户一致性进行了分析,并探讨了分歧对系统排名的影响。与先前的研究不同,我们关注一个由转录为两分钟片段的音频文件组成的集合——TREC 2020和2021播客赛道。我们采用五种不同的LLM模型重新评估了所有查询-片段对,这些对最初由TREC评估员标注。此外,我们重新评估了LLM与TREC评估员分歧最大的一个小子集,发现人类专家倾向于更同意LLM的判断,而非TREC评估员的判断。我们的结果强化了Sormunen在2002年的先前见解——依赖单一评估员会导致较低的用户一致性。

关键词

引用

@article{arxiv.2601.05603,
  title  = {Revisiting Human-vs-LLM judgments using the TREC Podcast Track},
  author = {Watheq Mansour and J. Shane Culpepper and Joel Mackenzie and Andrew Yates},
  journal= {arXiv preprint arXiv:2601.05603},
  year   = {2026}
}

备注

Version 2: The paper has been accepted to appear at ECIR 2026