中文

ViInfographicVQA:越南信息图单图与多图视觉问答基准

计算机视觉与模式识别 2025-12-16 v1 机器学习

摘要

信息图视觉问答(InfographicVQA)评估模型阅读和推理数据密集型、布局密集型视觉内容的能力,这些内容结合了文本、图表、图标和设计元素。与场景文本或自然图像VQA相比,信息图需要更强的OCR、布局理解以及数值和语义推理能力。我们提出了ViInfographicVQA——首个越南信息图VQA基准,包含超过6747个真实世界信息图和20409个人类验证的问答对,涵盖经济学、医疗保健、教育等领域。该基准包含两种评估设置。单图任务遵循传统设置,每个问题使用一张信息图进行回答。多图任务要求综合多个语义相关的信息图中的证据,据我们所知,这是VQA中首个越南跨图像推理评估。我们在该基准上评估了一系列最新的视觉语言模型,揭示了显著的性能差异,最显著的错误出现在涉及跨图像集成和非跨度推理的多图问题上。ViInfographicVQA为越南信息图VQA贡献了基准结果,并揭示了当前多模态模型在低资源环境中的局限性,鼓励未来探索布局感知和跨图像推理方法。

关键词

引用

@article{arxiv.2512.12424,
  title  = {ViInfographicVQA: A Benchmark for Single and Multi-image Visual Question Answering on Vietnamese Infographics},
  author = {Tue-Thu Van-Dinh and Hoang-Duy Tran and Truong-Binh Duong and Mai-Hanh Pham and Binh-Nam Le-Nguyen and Quoc-Thai Nguyen},
  journal= {arXiv preprint arXiv:2512.12424},
  year   = {2025}
}

备注

10 pages, 4 figures, Accepted to AI4Research @ AAAI