大语言模型自动相关性评估在公平可靠检索评测中的局限性
信息检索
2025-07-23 v3
摘要
搜索系统的离线评测依赖于测试集。这些基准为研究人员提供了文档语料库、主题以及指示哪些文档与每个主题相关的相关性判定。虽然测试集是信息检索(IR)研究不可或缺的组成部分,但其创建涉及大量的人工标注工作。大语言模型(LLM)作为自动相关性评估工具正受到广泛关注。近期研究表明,基于 LLM 的评估与人工判定在系统排名上具有较高的相关性。这些相关性在大规模实验中很有用,但如果我们想关注表现优异的系统,其信息量则不足。此外,这些相关性忽略了基于 LLM 的判定是否以及如何影响系统相对于人工评估在统计显著性差异上的表现。在这项工作中,我们研究了 LLM 生成的判定如何保留表现优异的系统之间的排名差异,以及它们如何像人工判定那样保留成对显著性评估。我们的结果表明,基于 LLM 的判定在排名表现优异的系统时是不公平的。此外,我们观察到在统计差异方面存在极高的假阳性率。我们的工作在评估基于 LLM 的判定用于 IR 评测的可靠性方面迈出了一步。我们希望这能作为其他研究人员开发更可靠的自动相关性评估模型的基础。
引用
@article{arxiv.2411.13212,
title = {Limitations of Automatic Relevance Assessments with Large Language Models for Fair and Reliable Retrieval Evaluation},
author = {David Otero and Javier Parapar and Álvaro Barreiro},
journal= {arXiv preprint arXiv:2411.13212},
year = {2025}
}