ARIAL:面向精确答案定位的文档 VQA 代理框架
计算机视觉与模式识别
2025-12-01 v2 人工智能
摘要
文档视觉问答(VQA)要求模型不仅提取准确的文本答案,还需在文档图像中精确定位答案,这一能力对于高风险应用中的可解释性至关重要。然而,现有系统在获得强大的文本准确性的同时会产生不可靠的空间定位,或为实现可解释性而牺牲性能。我们提出 ARIAL(Agentic Reasoning for Interpretable Answer Localization),一种模块化框架,通过基于 LLM 的规划代理协调专用工具,以实现精确的答案提取与可靠的空间定位。ARIAL 将文档 VQA 分解为结构化子任务:基于 OCR 的文本提取(使用 TrOCR)、通过语义搜索进行检索增强的上下文选择、通过微调的 Gemma 3-27B 模型生成答案,以及通过文本到区域对齐实现显式边界框定位。该模块化架构产生透明的推理�迹,使工具级别的可审计性和独立组件优化成为可能。在四个基准测试(DocVQA、FUNSD、CORD 和 SROIE)上使用文本准确性(ANLS)和空间精度(IoU 为 0.50 到 0.95 的 mAP)进行评估。ARIAL 在所有数据集上均实现了最前沿的结果:DocVQA 上为 88.7 ANLS 和 50.1 mAP,FUNSD 上为 90.0 ANLS 和 50.3 mAP,CORD 上为 85.5 ANLS 和 60.2 mAP,SROIE 上为 93.1 ANLS,超越了之前最佳方法 DLaVA 在 DocVQA 上的 +2.8 ANLS 和 +3.9 mAP。我们的工作表明,代理化工具协调能够同时提升性能与可解释性,为构建可信且可解释的文档 AI 系统提供了一条路径。
引用
@article{arxiv.2511.18192,
title = {ARIAL: An Agentic Framework for Document VQA with Precise Answer Localization},
author = {Ahmad Mohammadshirazi and Pinaki Prasad Guha Neogi and Dheeraj Kulshrestha and Rajiv Ramnath},
journal= {arXiv preprint arXiv:2511.18192},
year = {2025}
}