不要使用LLM进行相关性判断
信息检索
2025-03-27 v2
摘要
为TREC式测试集合进行相关性判断是既复杂又昂贵的。典型的TREC赛道通常涉及由六名承包商为2-4周工作。这些承包商需要接受培训并受到监控。必须编写软件来正确且高效地记录相关性判断。近期大型语言模型能够产生惊人的类人流畅文本输出以响应自然语言提示,这激发了信息检索研究人员思考这些模型在相关性判断收集过程中的应用。2024年ACM SIGIR会议上的一个工作坊“LLM4Eval”为此工作提供了平台,包含数据挑战活动,其中参与者复现了Thomas等人(arXiv:2408.08896, arXiv:2309.10621)所做的TREC深度学习轨道的相关性判断。我受邀在该工作坊上做题鉴演讲,本文即将演讲内容以文章形式呈现。以结果为导向的核心信息是:不要使用LLM来创建TREC式评估的相关性判断。
引用
@article{arxiv.2409.15133,
title = {Don't Use LLMs to Make Relevance Judgments},
author = {Ian Soboroff},
journal= {arXiv preprint arXiv:2409.15133},
year = {2025}
}