The Visualization JUDGE : Can Multimodal Foundation Models Guide Visualization Design Through Visual Perception?
人机交互
2024-10-08 v1
摘要
面向视觉和语言的基础模型是AI应用跨越社会众多领域的基础。这些模型的成功归功于其模仿人类能力的能力,即视觉模型中的视觉感知能力以及大型语言模型中的分析推理能力。由于视觉感知与分析是数据可视化的基本要素,本文我们提出:如何利用基础模型推动可视化设计的进步?具体而言,多模态基础模型(MFM)如何通过视觉感知指导可视化设计?我们通过调查MFM对可视化感知的有效性,形式化整体可视化设计和优化空间。具体我们认为,MFM可以最佳地作为评判家,具备批评可视化并为我们提供改进可视化的行动的能力。我们对文本到图像生成模型和多模态大型语言模型进行更深入的表征,这些模型按其提供的输出及如何利用输出来指导设计决策进行组织。我们希望我们的视角能够激发可视化领域的研究者如何处理MFM以进行可视化设计。
引用
@article{arxiv.2410.04280,
title = {The Visualization JUDGE : Can Multimodal Foundation Models Guide Visualization Design Through Visual Perception?},
author = {Matthew Berger and Shusen Liu},
journal= {arXiv preprint arXiv:2410.04280},
year = {2024}
}