多模态大语言模型可视化素养:基于比较研究
计算与语言
2024-07-17 v1 人工智能
人机交互
摘要
近期出现的多模态大型语言模型 (MLLM) 将大型语言模型 (LLM) 的内在优势与对多模态情境进行推理的新能力相结合。MLLM 的潜在应用场景远远超过文本模型。近期许多关于可视化的工作已证明 MLLM 能够理解和解释可视化结果,并以自然语言向用户解释可视化内容。在机器学习领域,MLLM 的通用视觉能力已通过各种视觉理解基准进行评估和测试。然而,MLLM 完成基于视觉感知的特定可视化任务的能力尚未得到proper地探索和评估,尤其是从以可视化为中心的视角。本文旨在填补这一空白,通过可视化素养的概念来评估 MLLM。我们 assess MLLM 在两个流行的可视化素养评估数据集(VLAT 和 mini-VLAT)上的性能。在可视化素养框架下,我们构建了通用设置,用于比较不同多模态大型语言模型(如 GPT4-o、Claude 3 Opus、Gemini 1.5 Pro),以及与现有人类基线进行对比。我们的研究表明,MLLM 在可视化素养方面表现出竞争力,其中在识别相关性、聚类和层次结构等任务中超过了人类。
引用
@article{arxiv.2407.10996,
title = {Visualization Literacy of Multimodal Large Language Models: A Comparative Study},
author = {Zhimin Li and Haichao Miao and Valerio Pascucci and Shusen Liu},
journal= {arXiv preprint arXiv:2407.10996},
year = {2024}
}