中文

DLaVA:面向答案定位的文档语言与视觉助手,提升可解释性与可信度

计算机视觉与模式识别 2025-07-11 v2 人工智能

摘要

文档视觉问答 (VQA) 需要稳健地集成文本检测、识别和空间推理,以解释复杂的文档布局。在本工作中,我们引入 DLaVA,这是一个新颖的、无需训练的管道,利用多模态大语言模型 (MLLM) 实现零样图答案定位,以提高可信度、可解释性和可解释性。通过一种创新的 OCR-free 方法,将文本区域组织为带有唯一边界框 ID 的区域,从而在不依赖迭代 OCR 或链式思考的情况下保留空间上下文,从而大幅降低计算复杂度。我们进一步通过集成交并比 (IoU) 指标与平均归一化 Levenshtein 相似度 (ANLS),增强了评估协议,从而确保不仅考虑文本准确性,还考虑空间准确性,从而最终降低 AI 幻觉的风险,提高可信度。在基准数据集上的实验表明,DLaVA 的性能与最新技术相当,计算复杂度显著降低,准确性和可靠性提升,特别适用于高风险应用。DLaVA 所使用的代码和数据集可在 https://github.com/ahmad-shirazi/AnnotMLLM 上获取。

关键词

引用

@article{arxiv.2412.00151,
  title  = {DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness},
  author = {Ahmad Mohammadshirazi and Pinaki Prasad Guha Neogi and Ser-Nam Lim and Rajiv Ramnath},
  journal= {arXiv preprint arXiv:2412.00151},
  year   = {2025}
}