中文

面向自解释式文档视觉问答的链式解释预测

机器学习 2026-05-08 v1 计算机视觉与模式识别

摘要

文档视觉问答 (DocVQA) 需要视觉语言模型不仅推理文档中与问题相关的信息,还要确定答案在页面上的具体位置。现有 DocVQA 模型将问题相关证据与答案定位 entangled,基本作为黑盒子工作,提供有限的手段来验证预测如何依赖于视觉证据。我们提出 CoExVQA,一个具有链式解释设计的自解释式 DocVQA 框架,通过明确的推理过程实现。CoExVQA 首先识别问题相关证据,然后显式定位答案区域,最后仅从该区域解码答案。通过 CoExVQA 的链式解释进行预测,可直接检查和验证跨模态的推理过程。实验结果表明,将解码限制在基于证据的区域可实现在 PFL-DocVQA 上实现自解释 DocVQA 的 SotA 水平,ANLS 提升 12%,同时提供透明且可验证的预测。

关键词

引用

@article{arxiv.2605.06058,
  title  = {Towards Self-Explainable Document Visual Question Answering with Chain-of-Explanation Predictions},
  author = {Kjetil Indrehus and Adrian Duric and Changkyu Choi and Ali Ramezani-Kebrya},
  journal= {arXiv preprint arXiv:2605.06058},
  year   = {2026}
}