中文

肥皮打翻:多模态大语言模型可视化素养的逐部分定量探索

人机交互 2025-04-04 v1

摘要

多模态大语言模型 (MLLM) 能够解释数据可视化,但这些模型到底是什么使可视化易于理解?诸如颜色、形状和文本等因素是否影响可读性,这与人类感知有何不同?本文在先前工作基础上,系统评估哪些可视化特征影响 MLLM 的可解释性。我们将可视化素养评估测试集 (VLAT) 从 12 个扩展到 380 个可视化,方法是变更图表类型、颜色和标题。这使我们能够对这些特征如何影响模型性能进行统计分析。我们的发现表明,虽然颜色调色板对准确率没有显著影响,但图表类型和标题类型显著影响 MLLM 的性能。我们观察到类似的趋势也适用于模型遗漏现象。基于这些见解,我们研究不同任务中哪些图表类型对 MLLM 有益,并提出增强 MLLM 可读性的可视化设计原则。此外,我们将扩展后的 VLAT 测试集 (VLAT ex) 及其补充材料一并公开于 https://osf.io/ermwx/,供未来模型测试和评估使用。

关键词

引用

@article{arxiv.2504.02217,
  title  = {The Plot Thickens: Quantitative Part-by-Part Exploration of MLLM Visualization Literacy},
  author = {Matheus Valentim and Vaishali Dhanoa and Gabriela Molina León and Niklas Elmqvist},
  journal= {arXiv preprint arXiv:2504.02217},
  year   = {2025}
}

备注

11 pages, 8 figures