中文

看或记忆:多模态大语言模型解决可视化问答任务中视觉作用的合理性检验

人机交互 2025-04-23 v2 人工智能

摘要

近期发展使多模态大语言模型(MLLM)能够联合处理视觉和语言,从而使其能够感知并就数据可视化在各种设计和任务上的问题进行推理。将MLLM应用于广泛的可视化任务需要正确评估其能力,而最常见的评估方式是衡量模型的可视化推理能力,这类似于我们对人类对可视化理解的评估(例如,可视化素养)。然而,我们发现,在可视化问答(VisQA)语境中,MLLM感知和推理可视化的方式可能与人类完全不同。在评估过程中,即使没有提供可视化信息,模型仍能正确回答相当比例的可视化测试问题,这与是否提供选项无关。我们假设,大量先验知识编码在语言模型中,使得事实记忆能力超越了从视觉信号中获取信息的需求。这引出了一个问题:当前的VisQA评估是否充分捕捉了模型的可视化推理能力。为此,我们提出了一套全面的合理性检验框架,集成基于规则的决策树和合理性检验表格,以消解“看到”(视觉处理)与“记忆”(依赖先验知识)的影响。我们的研究验证了VisQA数据集的评估,揭示了模型在哪些方面真正“看到”了,哪些方面受事实记忆正或负影响,或依赖于归纳偏差进行问答。本研究强调,在利用MLLM时,必须仔细考虑未来可视化理解研究的设计。

关键词

引用

@article{arxiv.2504.09809,
  title  = {See or Recall: A Sanity Check for the Role of Vision in Solving Visualization Question Answer Tasks with Multimodal LLMs},
  author = {Zhimin Li and Haichao Miao and Xinyuan Yan and Valerio Pascucci and Matthew Berger and Shusen Liu},
  journal= {arXiv preprint arXiv:2504.09809},
  year   = {2025}
}