探索视觉语言模型的可视化素养:好、坏与丑
人机交互
2025-04-09 v1
摘要
视觉语言模型(VLMs)在图表理解方面表现出前景,但以往的研究仅限于评估其响应正确性,未能探索其内部推理过程。为此,我们采用注意力引导的类激活图(AG-CAM)用于VLMs,以可视化输入特征(图像和文本)对模型响应的影响和重要性。我们采用此方法,对四个开源模型(ChartGemma、Janus 1B和7B、LLaVA)和两个闭源模型(GPT-4o、Gemini)进行评估,比较其性能及对开源模型而言,其AG-CAM结果。总体而言,我们发现ChartGemma—a 3B参数VLm专为图表问答微调,表现优于其他开源模型,性能与规模显著更大的闭源VLm相当。我们还发现VLm表现出空间推理,通过准确局部化关键图表特征,以及语义推理,通过将视觉元素与相应数据值和查询标记关联。我们的做法是首次在早期融合VLm架构上应用AG-CAM,这些架构广泛使用,尤其是针对图表问答。我们还显示,这些结果的初步证据可与人类推理一致。我们的有前景的开源VLm结果为透明且可复现的AI可视化素养研究铺平了道路。
引用
@article{arxiv.2504.05445,
title = {Probing the Visualization Literacy of Vision Language Models: the Good, the Bad, and the Ugly},
author = {Lianghan Dong and Anamaria Crisan},
journal= {arXiv preprint arXiv:2504.05445},
year = {2025}
}