事实还是假象?评估现代检索器的事实鲁棒性
信息检索
2025-08-29 v1
摘要
密集检索器和重排序器是检索增强生成(RAG)管道的核心组件,其中准确检索事实信息对于维护系统可信度和抵御 RAG poisoning 至关重要。然而,人们对这些组件从大型语言模型(LLM)继承或丢失多少事实能力几乎不知情。我们将 12 个公开发布的嵌入检查点与其原始基础 LLM 配对,并在事实鲁棒性基准测试中对两者进行评估。在所评估的每个模型中,嵌入变体的准确率均显著低于其基础模型,准确度下降范围从 12 个百分点到 43 个百分点(中位数 28 分),而典型的检索器准确率跌入 25%-35% 区间,而生成模型则达到 60%-70%。在更严苛条件下,这种退化现象更为明显:当每个问题的候选池从四个选项扩大到一千个后,最强检索器的 Top-1 准确率从 33% 下降到 26%,揭示了其对干扰项数量的敏感性。统计检验进一步表明,对于每个嵌入模型,查询与正确完成词向量之间的余弦相似度得分显著高于与错误完成之间的得分(p < 0.01),表明决策主要受表层语义接近性驱动,而非事实推理。为探索这一弱点,我们使用 GPT-4.1 对每个正确完成进行改写,创建了一个保留事实真实性同时遮蔽词汇线索的重写测试集,并观察到超过 2/3 的先前正确预测被改写为错误,使整体准确率降至原水平的约三分之一。综上,这些发现揭示了对检索器进行对比学习所引入的系统性权衡:在语义检索方面的提升,往往以在参数化事实知识方面的损失为代价。
引用
@article{arxiv.2508.20408,
title = {Fact or Facsimile? Evaluating the Factual Robustness of Modern Retrievers},
author = {Haoyu Wu and Qingcheng Zeng and Kaize Ding},
journal= {arXiv preprint arXiv:2508.20408},
year = {2025}
}
备注
Proceedings of the 34th ACM International Conference on Information and Knowledge Management