中文

CHARTOM:面向大语言模型的误导性图表视觉心智理论基准

人工智能 2025-07-01 v3 计算与语言 计算机视觉与模式识别

摘要

我们引入了CHARTOM,一个视觉心智理论基准,旨在评估多模态大语言模型理解和推理误导性数据可视化图表的能力。CHARTOM包含精心设计的图表及相关问题,要求语言模型不仅正确理解图表中的事实内容(事实问题),还要判断该图表是否会对人类读者产生误导(心智问题),这种双重能力具有显著的社会效益。我们详细介绍了基准的构建过程,包括其在人类表现上的校准以及心智问题真值(称为人类误导性指数)的估计。我们在CHARTOM数据集上评估了多个领先的LLMs——包括GPT、Claude、Gemini、Qwen、Llama和Llava系列模型——发现所有模型在事实问题和心智问题上均面临挑战。这凸显了当前LLMs的局限性,并为未来LLMs在理解误导性图表方面提供了重要改进机会。

关键词

引用

@article{arxiv.2408.14419,
  title  = {CHARTOM: A Visual Theory-of-Mind Benchmark for LLMs on Misleading Charts},
  author = {Shubham Bharti and Shiyun Cheng and Jihyun Rho and Jianrui Zhang and Mu Cai and Yong Jae Lee and Martina Rau and Xiaojin Zhu},
  journal= {arXiv preprint arXiv:2408.14419},
  year   = {2025}
}