DRISHTIKON:文档中多粒度视觉定位
计算机视觉与模式识别
2025-07-17 v2
摘要
文档图像中的视觉定位是文档智能和视觉问答(VQA)系统中尚未充分探索的关键挑战。我们提出了 DRISHTIKON,一个多粒度、多块视觉定位框架,旨在增强 VQA 系统在复杂多语言文档中的可解释性和可信度。我们的方法整合了多语言 OCR、大语言模型和一种新颖的区域匹配算法,以块、行、词和点级别本地化答案 spans。我们引入了多粒度视觉定位(MGVG)基准测试,是一个包含来自各行业领域的多样化圆形通知的测试集,每个通知在多个粒度上都有细粒度的人工标注标签。大量实验表明,我们的方法实现了最先进的定位准确率,其中线级粒度在精度和召回率之间提供了最佳平衡。消融研究进一步突显了多块和多行推理的优势。比较评估显示,领先的视觉语言模型在精确定位方面存在困难,凸显了我们结构化、基于对齐的方法的有效性。我们的发现为在具有多粒度定位支持的真实世界、文本导向场景中的更稳健和可解释的文档理解系统铺平了道路。代码和数据集已公开供未来研究使用。
引用
@article{arxiv.2506.21316,
title = {DRISHTIKON: Visual Grounding at Multiple Granularities in Documents},
author = {Badri Vishal Kasuba and Parag Chaudhuri and Ganesh Ramakrishnan},
journal= {arXiv preprint arXiv:2506.21316},
year = {2025}
}
备注
Work in Progress