中文

DocSeeker:用于长文档理解的结构化视觉推理与证据定位

人工智能 2026-05-12 v5

摘要

现有的多模态大语言模型(MLLMs)在文档长度增加时会出现显著的性能下降。这源于两个根本挑战:1)信噪比(SNR)较低,关键证据被掩埋在无关页面中;2)监督稀缺,仅提供最终简短答案的数据集会导致学习信号较弱。本文通过提出一种需要模型执行结构化的“分析、定位与推理”工作流程的范式来解决这些挑战。为培养这种能力,我们设计了一个两阶段训练框架:首先通过高质量数据的监督微调(SFT),这些数据是通过高效知识蒸馏策略生成的;随后采用证据感知的群体相对策略优化(Evidence-aware Group Relative Policy Optimization),联合优化证据定位和答案准确性。此外,我们引入了证据导向的分辨率分配策略,以缓解训练于多页文档的内存限制。大量实验表明,DocSeeker 在同一领域和异域任务上均实现了优异性能。我们展示它能够从短页训练中稳健地泛化到超长文档,并且与视觉检索增强生成(RAG)系统天然协同,为其实现提供了坚实的基础。

关键词

引用

@article{arxiv.2604.12812,
  title  = {DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding},
  author = {Hao Yan and Yuliang Liu and Xingchen Liu and Yuyi Zhang and Minghui Liao and Jihao Wu and Wei Chen and Xiang Bai},
  journal= {arXiv preprint arXiv:2604.12812},
  year   = {2026}
}

备注

CVPR 2026 Highlight