大语言模型可修复评估中的缺失相关性判断
信息检索
2024-05-09 v1
摘要
未给予判断的文档或信息检索基准中的空白被视为非相关,导致无法提升测量效果。然而,这些缺失判断可能因汇聚过程而对检索模型的 prevalences 而引入偏置。因此,填补空白对于确保可靠和准确的评估至关重要。收集所有文档的主观判断既费时又不切实际。本文旨在利用大语言模型(LLMs)自动标记未给予判断的文档。我们的目标是使用详细指令指示 LLM 为空白分配细粒度相关性判断。为此,我们通过随机删除 TREC DL tracks 中相关文档的相关性判断,系统模拟空白程度不同的情景。我们的实验显示,我们基于 LLM 的方法与真实相关性判断之间存在强相关性。在在三个 TREC DL 数据集上进行的模拟实验中,在仅保留 10% 判断的极端情景下,我们的方法在 Vicuña-7B 和 GPT-3.5 Turbo 上分别实现了 0.87 和 0.92 的 Kendall tau 相关性。
引用
@article{arxiv.2405.04727,
title = {LLMs Can Patch Up Missing Relevance Judgments in Evaluation},
author = {Shivani Upadhyay and Ehsan Kamalloo and Jimmy Lin},
journal= {arXiv preprint arXiv:2405.04727},
year = {2024}
}
备注
5 pages, 4 figures