预训练与大型语言模型时代的查询扩展:综合调查
信息检索
2026-05-08 v3
摘要
现代信息检索必须将短而模糊的查询与日益多样化和动态的语料库相容。查询扩展(QE)是缓解词汇不匹配的核心技术,但其设计空间已被重塑。本调查综述了PLM/LLM时代的QE方法,提供统一的视角。我们首先总结了不同模型家族如何启用新的扩展行为,包括更强的上下文化、更可控的生成以及指令遵循。随后我们沿四个互补的设计维度组织最近的技术:扩展被注入管道中的位置、其如何被 grounding 并与语料证据交互、其如何学习或对齐,以及结构化知识如知识图谱如何被整合。除了分类,我们综合了应用模式和部署考虑,突出了在代表性检索设置下的实际权衡,包括有效性、可控性、grounding质量和运行成本之间的权衡。最后,我们勾勒了在现实约束下更可靠、更安全、更高效和持续适应的QE的开放挑战和未来方向。
引用
@article{arxiv.2509.07794,
title = {Query Expansion in the Age of Pre-trained and Large Language Models: A Comprehensive Survey},
author = {Minghan Li and Xinxuan Lv and Junjie Zou and Tongna Chen and Chao Zhang and Suchao An and Ercong Nie and Guodong Zhou},
journal= {arXiv preprint arXiv:2509.07794},
year = {2026}
}
备注
42 pages,10 figures,6 tables