中文

大型语言模型是否偏好新近内容?关于基于LLM的重排序中时间偏差的研究

信息检索 2025-09-16 v1

摘要

大型语言模型(LLMs)越来越多地部署在信息系统中,包括在信息检索流程中用作第二阶段重排序器,然而它们对时间偏差的敏感性却很少受到关注。我们通过在TREC深度学习段落检索集合2021(DL21)和2022(DL22)的段落前添加人为的发表日期,研究LLMs是否隐含地偏好更新的文档。在七个模型中,GPT-3.5-turbo、GPT-4o、GPT-4、LLaMA-3 8B/70B和Qwen-2.5 7B/72B,“新鲜”段落被一致地提升,在我们的列表式重排序实验中,将Top-10的平均发表年份向前推移了最多4.78年,并将单个项目移动了多达95个排名。尽管较大的模型减弱了这种效应,但没有一个模型能消除它。我们还观察到,在我们的成对偏好实验中,在注入日期后,LLMs对两个相关性水平相同的段落之间的偏好平均可被逆转高达25%。这些发现为LLMs中普遍存在的时间偏差提供了定量证据,并强调了有效偏差缓解策略的重要性。

关键词

引用

@article{arxiv.2509.11353,
  title  = {Do Large Language Models Favor Recent Content? A Study on Recency Bias in LLM-Based Reranking},
  author = {Hanpei Fang and Sijie Tao and Nuo Chen and Kai-Xin Chang and Tetsuya Sakai},
  journal= {arXiv preprint arXiv:2509.11353},
  year   = {2025}
}