大语言模型时代长文档检索综述
信息检索
2025-10-28 v2
摘要
长格式文档的不断涌现对信息检索(IR)提出了根本性挑战,因为它们的长度、分散的证据以及复杂的结构要求超越标准段落级技术的专门方法。本综述提供了对长文档检索(LDR)的首个全面论述,系统化地整合了跨三个主要时代的方法、挑战和应用。我们系统化地梳理了从经典词典方法和早期神经模型到现代预训练(PLM)和大语言模型(LLM)的演变,涵盖关键范式,如段落聚合、层次编码、高效注意力以及最新的LLM驱动的重排序和检索技术。除了模型本身,本综述还回顾了领域特定应用、专门的评估资源,并概述了关键开放挑战,如效率权衡、多模态对齐和忠实性。本综述旨在为长文档检索在基础模型时代提供一个已合并的参考资料和前瞻性议程。
引用
@article{arxiv.2509.07759,
title = {A Survey of Long-Document Retrieval in the PLM and LLM Era},
author = {Minghan Li and Miyang Luo and Tianrui Lv and Yishuai Zhang and Siqi Zhao and Ercong Nie and Guodong Zhou},
journal= {arXiv preprint arXiv:2509.07759},
year = {2025}
}
备注
32 pages, 6 figures