假设文档还是知识泄露?重新思考基于 LLM 的查询扩展
计算与语言
2025-06-05 v2 信息检索
摘要
由大语言模型(LLM)驱动的查询扩展方法在零样本检索任务中展现出显著效果。这些方法假设 LLM 能够生成假设文档,将其纳入查询向量后,可增强检索真实证据的能力。然而,我们质疑这一假设,通过考察事实验证为测试场景,分析生成文档是否包含由黃金证据所支撑的句子信息,并评估其对性能的影响。我们的发现表明,平均而言,针对生成文档包含黄金证据所支撑句子的主张,性能提升始终显著。这表明,知识泄露可能已存在于事实验证基准中,潜在地高估了基于 LLM 的查询扩展方法的 perceived performance。
引用
@article{arxiv.2504.14175,
title = {Hypothetical Documents or Knowledge Leakage? Rethinking LLM-based Query Expansion},
author = {Yejun Yoon and Jaeyoon Jung and Seunghyun Yoon and Kunwoo Park},
journal= {arXiv preprint arXiv:2504.14175},
year = {2025}
}
备注
ACL 2025 (Findings)