Tau@LLMJudge:基于准则的相关性评估
信息检索
2024-10-21 v1 人工智能
摘要
传统的信息检索(IR)系统评估依赖人工标注的相关性标签,这在规模化时可能存在偏见且成本高昂。在此背景下,大语言模型(LLM)提供了一种通过直接提示它们为与每个查询相关的段落分配相关性标签的替代方法。本研究探索了直接提示LLM获取相关性标签的不同方法,通过探讨两种假设来指导:假设1认为将“相关性”分解为具体准则——准确性、覆盖性、主题性和情境匹配——对获取相关性标签有帮助。我们探索了不同的方法,通过提示大语言模型(LLM)获取所有段落的准则级别评分,并考虑将准则级别评分聚合为相关性标签的各种方式。假设2认为,查询与段落之间的语言风格差异可能对自动相关性标签预测产生负面影响。我们探讨了通过首先合成段落摘要,使其采用查询的语言风格,然后使用该摘要代替段落来评估其相关性,从而实现改进的可能性。我们包括了基于2024年夏季LLMJudge挑战数据的实证评估,其中我们的“四提示”方法在Kendall's tau上取得了最高分。
关键词
引用
@article{arxiv.2410.14044,
title = {Best in Tau@LLMJudge: Criteria-Based Relevance Evaluation with Llama3},
author = {Naghmeh Farzi and Laura Dietz},
journal= {arXiv preprint arXiv:2410.14044},
year = {2024}
}