中文

用于检索评估的合成测试集

信息检索 2024-05-14 v1 人工智能

摘要

测试集在信息检索(IR)系统的评估中扮演着至关重要的角色。为构建测试集获取多样化的用户查询可能具有挑战性,而获取相关性判断(指示检索到的文档与查询的匹配程度)通常成本高昂且资源密集。使用大语言模型(LLMs)生成合成数据集最近在各种应用中引起了广泛关注。在IR领域,虽然先前的工作利用LLMs的能力生成合成查询或文档来增强训练数据并提升排序模型的性能,但使用LLMs构建合成测试集的研究相对较少。先前的研究表明,LLMs有潜力生成用于评估IR系统的合成相关性判断。在本文中,我们全面研究了是否可以使用LLMs通过不仅生成合成判断,还生成合成查询来构建完全合成的测试集。具体而言,我们分析了构建可靠的合成测试集的可能性,以及此类测试集可能对基于LLM的模型产生偏见的潜在风险。我们的实验表明,使用LLMs可以构建能够可靠用于检索评估的合成测试集。

关键词

引用

@article{arxiv.2405.07767,
  title  = {Synthetic Test Collections for Retrieval Evaluation},
  author = {Hossein A. Rahmani and Nick Craswell and Emine Yilmaz and Bhaskar Mitra and Daniel Campos},
  journal= {arXiv preprint arXiv:2405.07767},
  year   = {2024}
}

备注

SIGIR 2024