中文

基于 VLM 的可靠且可解释的文档问答

计算与语言 2025-09-16 v2 信息检索

摘要

视觉语言模型在文档理解方面展现出了强大的能力,特别是在从复杂文档中识别和提取文本信息方面。尽管如此,在文档中精确定位答案仍然是一项重大挑战,这限制了模型的可解释性和现实世界适用性。为了解决这一问题,我们引入了 DocExplainerV0,这是一个即插即用的边界框预测模块,将答案生成与空间定位解耦。这种设计使其适用于现有的 VLM,包括无法进行微调的专有系统。通过系统评估,我们提供了关于文本准确性与空间定位之间差距的定量见解,表明正确的答案往往缺乏可靠的定位。我们的标准化框架突出了这些缺陷,并为未来致力于开发更具可解释性和鲁棒性的文档信息提取 VLM 建立了基准。

关键词

引用

@article{arxiv.2509.10129,
  title  = {Towards Reliable and Interpretable Document Question Answering via VLMs},
  author = {Alessio Chen and Simone Giovannini and Andrea Gemelli and Fabio Coppini and Simone Marinai},
  journal= {arXiv preprint arXiv:2509.10129},
  year   = {2025}
}