DRAGON:基于图表的证据导向视觉推理基准
计算机视觉与模式识别
2026-04-29 v1 人工智能
计算与语言
摘要
图表问答(DQA)要求模型解释结构化视觉表征,如图表、地图、信息图、电路示意图和科学图。近期视觉语言模型(VLM)在此类任务上常取得高准确率,但正确答案不一定保证模型在支持预测的图表区域进行推理。模型可能仅依赖文本相关性或数据集副作用,而未识别验证答案所需的视觉证据。这种局限性阻碍了图表推理的可靠评估,并降低了可解释性。我们引入 DRAGON,用于评估图表中证据导向视觉推理。给定图表、问题和正确答案,模型必须预测与支持答案的视觉元素对应的边界框。这些证据区域可能包括答案要素、文本标签、图例、坐标轴、连接器及其他参与推理过程的支持结构。DRAGON 数据集包含从六个图表问答数据集(ChartQA、Circuit-VQA、InfographicsVQA、MapIQ、MapWise 和 AI2D)收集的 11,664 个标注问题实例。我们发布了包含 2,445 个经人工验证推理证据标注的测试集,并提供标准化评估框架。我们评估了八个近期 VLM,分析其在不同图表领域中本地化推理证据的能力。DRAGON 实施了图表推理的系统评估,支持基于视觉证据对预测进行 grounding 的模型研究。
引用
@article{arxiv.2604.25231,
title = {DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams},
author = {Anirudh Iyengar Kaniyar Narayana Iyengar and Tampu Ravi Kumar and Gaurav Najpande and Manan Suri and Dinesh Manocha and Puneet Mathur and Vivek Gupta},
journal= {arXiv preprint arXiv:2604.25231},
year = {2026}
}
备注
22 Pages, 14 Figures