中文

如你所想:通过强化学习实现可验证文档检索增强生成的统一推理与视觉证据归因

人工智能 2025-12-02 v2

摘要

旨在从视觉文档中识别精确证据来源,视觉证据归因(visual evidence attribution)对于视觉文档检索增强生成(VD-RAG)至关重要,这确保了视觉语言模型(VLM)在多模态问答中的可靠且可验证的预测。现有方法多采用端到端训练以促进直观的答案验证,但缺乏推理过程中细粒度监督和渐进式可追溯性。本文引入证据链(Chain-of-Evidence, CoE)范式,用于VD-RAG。CoE将链路思考(Chain-of-Thought, CoT)推理与视觉证据归因统一,通过将参考元素锚定到具有边界框和页面索引的具体区域。为使VLM生成此类证据锚定推理,本文提出"如你所想"(Look As You Think, LAT)框架,这是一种强化学习框架,训练模型生成具有一致归因的可验证推理路径。在训练期间,LAT评估每个证据区域的归因一致性,仅当CoE轨迹产生正确答案时才提供奖励,以鼓励过程级自我验证。在基于Paper-和Wiki-VISA基准测试的实验中,使用Qwen2.5-VL-7B-Instruct模型显示,LAT在单图和多图设置中均显著提升,平均提升8.23%的软精确匹配(EM)和47.0%的[email protected]。 LAT不仅超越监督微调基线(后者直接生成带归因的答案),而且在跨域泛化方面表现更佳。

关键词

引用

@article{arxiv.2511.12003,
  title  = {Look as You Think: Unifying Reasoning and Visual Evidence Attribution for Verifiable Document RAG via Reinforcement Learning},
  author = {Shuochen Liu and Pengfei Luo and Chao Zhang and Yuhao Chen and Haotian Zhang and Qi Liu and Xin Kou and Tong Xu and Enhong Chen},
  journal= {arXiv preprint arXiv:2511.12003},
  year   = {2025}
}

备注

Poster of AAAI'2026