困惑陷阱:基于 PLM 的检索器高估低困惑文档
计算与语言
2025-03-12 v1 人工智能
信息检索
摘要
先前研究发现,基于 PLM 的检索模型倾向于 LLM 生成内容,为这些文档分配更高的相关性得分,即使其语义质量与人类撰写的文档相当。这种现象被称为源偏见(source bias),威胁了信息获取生态系统的可持续发展。然而,源偏见的 underlying 原因尚未被探索。本文我们运用因果图解释信息检索过程,发现 PLM 基于检索器学习困惑特征用于相关性估计,导致源偏见通过对低困惑文档进行排序来实现。理论分析进一步揭示,这一现象源于语言建模任务和检索任务损失函数梯度之间的正相关。在分析基础上,我们提出了一个基于因果推断的推断时去偏方法,称为因果诊断与纠正(Causal Diagnosis and Correction, CDC)。CDC 首先诊断困惑的偏差效应,然后从整体估计相关性得分中分离离该偏差效应。跨三个领域的实验结果表明,CDC 在去偏效果方面优于现有方法,强调我们提出的解释性框架的有效性。源代码可在 https://github.com/WhyDwelledOnAi/Perplexity-Trap 上获取。
关键词
引用
@article{arxiv.2503.08684,
title = {Perplexity Trap: PLM-Based Retrievers Overrate Low Perplexity Documents},
author = {Haoyu Wang and Sunhao Dai and Haiyuan Zhao and Liang Pang and Xiao Zhang and Gang Wang and Zhenhua Dong and Jun Xu and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2503.08684},
year = {2025}
}
备注
ICLR 2025