图表到体验:多模态大语言模型预测图表体验影响的基准测试
人机交互
2025-05-26 v1 计算与语言
摘要
多模态大语言模型(MLLM)在视觉理解任务中取得了显著进展,为预测图表的感知与情感影响提供了巨大机遇。然而这也引发了担忧,因为许多大语言模型的应用基于从少量样本中过度泛化的假设,缺乏对其性能与有效性的充分验证。我们提出了 Chart-to-Experience,一个包含 36 张图表的基准数据集,由众包工作者对其在七个体验因素上的影响进行评估。以该数据集为真值,我们评估了最先进的多模态大语言模型在两项任务上的能力:直接预测与图表的成对比较。我们的发现表明,多模态大语言模型在评估单张图表时不如人类评估者敏感,但在成对比较中准确且可靠。
引用
@article{arxiv.2505.17374,
title = {Chart-to-Experience: Benchmarking Multimodal LLMs for Predicting Experiential Impact of Charts},
author = {Seon Gyeom Kim and Jae Young Choi and Ryan Rossi and Eunyee Koh and Tak Yeon Lee},
journal= {arXiv preprint arXiv:2505.17374},
year = {2025}
}
备注
This paper has been accepted to IEEE PacificVis 2025