鸡尾酒:融合LLM生成文档的全面信息检索基准
信息检索
2024-07-03 v2 计算与语言
摘要
大型语言模型(LLM)的兴起导致互联网上AI生成内容(AIGC)激增,使信息检索(IR)系统的语料库从仅由人类撰写转变为人类编写与LLM生成内容并存。这种AIGC浪潮对IR系统的影响仍是未知数,主要挑战在于缺乏专门为研究者设计的基准数据集。本文引入鸡尾酒(Cocktail),一个针对LLM时代混合来源数据环境中评估IR模型的全面基准。鸡尾酒包含16个跨越多种文本检索任务与领域的多样化数据集,涵盖人类编写与LLM生成的语料。此外,为避免先前数据集信息可能引入的偏见,我们还引入了一个更新的数据集,即NQ-UTD,其查询源自近期事件。通过进行超过1000次实验评估针对鸡尾酒基准数据的前沿检索模型,我们发现神经检索模型在排序性能与来源偏见之间存在明显的权衡,这凸显了在设计未来IR系统时需要采取平衡方法的必要性。我们希望鸡尾酒能为LLM时代的IR研究提供基础资源,所有数据与代码均公开于\url{https://github.com/KID-22/Cocktail}。
引用
@article{arxiv.2405.16546,
title = {Cocktail: A Comprehensive Information Retrieval Benchmark with LLM-Generated Documents Integration},
author = {Sunhao Dai and Weihao Liu and Yuqi Zhou and Liang Pang and Rongju Ruan and Gang Wang and Zhenhua Dong and Jun Xu and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2405.16546},
year = {2024}
}
备注
Accepted by Findings of ACL 2024; Datasets Link: https://huggingface.co/IR-Cocktail