中文

InfoChartQA:用于信息图表多模态问答的基准

计算机视觉与模式识别 2025-10-30 v4 人工智能

摘要

理解包含设计驱动的视觉元素(如象征图、图标)的信息图表需要视觉识别与推理,这给多模态大语言模型(MLLMs)带来了挑战。然而,现有视觉问答基准缺乏配对的纯文本图表和基于视觉元素的问题,无法评估MLLMs的这些能力。为弥合这一差距,我们介绍InfoChartQA,这是一个用于评估MLLMs在信息图表理解方面的基准。该基准包含5642对信息图表和纯文本图表,每对图表共享相同的底层数据,但在视觉呈现方式上存在差异。我们进一步设计基于视觉元素的问题,以捕捉其独特的视觉设计和传达意图。对20个MLLMs的评估显示,在信息图表上的性能显著下降,尤其是与隐喻相关的视觉元素问题表现更差。配对的图表使我们能够进行细粒度的错误分析和消融研究,这为推进MLLMs在信息图表理解方面提供了新机遇。我们在https://github.com/CoolDawnAnt/InfoChartQA上发布InfoChartQA。

关键词

引用

@article{arxiv.2505.19028,
  title  = {InfoChartQA: A Benchmark for Multimodal Question Answering on Infographic Charts},
  author = {Tianchi Xie and Minzhi Lin and Mengchen Liu and Yilin Ye and Changjian Chen and Shixia Liu},
  journal= {arXiv preprint arXiv:2505.19028},
  year   = {2025}
}