神经检索器对LLM生成内容存在偏向
信息检索
2024-08-01 v3 人工智能
计算与语言
摘要
近来,大语言模型(LLMs)的出现通过在互联网上生成大量类人文本,革新了信息检索(IR)应用(尤其是网页搜索)的范式。结果,LLM时代的IR系统面临一新挑战:被索引文档如今不仅由人类撰写,也由LLM自动生成。这些LLM生成文档如何影响IR系统是一个紧迫且仍未被探索的问题。在本工作中,我们在同时涉及人类撰写与LLM生成文本的场景下对IR模型进行定量评估。令人惊讶的是,我们的发现表明神经检索模型倾向于将LLM生成文档排得更靠前。我们将神经检索器中对LLM生成内容的此类偏向称为\textbf{来源偏向}。此外,我们发现该偏向不仅限于第一阶段神经检索器,还延伸至第二阶段神经重排序器。接着,从文本压缩视角的深入分析表明,LLM生成文本展现出更聚焦的语义与更少噪声,使神经检索模型更易进行语义匹配。为缓解来源偏向,我们还针对优化目标提出了一个即插即用的去偏约束,实验结果显示了其有效性。最后,我们讨论了由所观测来源偏向引发的潜在严重隐患,并希望我们的发现能作为对IR界及更广领域的紧要警示。为便利LLM时代IR的未来探索,所构建的两个新基准可见于 https://github.com/KID-22/Source-Bias。
引用
@article{arxiv.2310.20501,
title = {Neural Retrievers are Biased Towards LLM-Generated Content},
author = {Sunhao Dai and Yuqi Zhou and Liang Pang and Weihao Liu and Xiaolin Hu and Yong Liu and Xiao Zhang and Gang Wang and Jun Xu},
journal= {arXiv preprint arXiv:2310.20501},
year = {2024}
}
备注
KDD 2024