ChartFI:多模态大语言模型图表描述忠实性与洞察性基准
计算与语言
2026-05-25 v1
摘要
图表描述对于无障碍访问、跨模态检索以及帮助读者从复杂可视化中提取洞察力至关重要。随着多模态大语言模型(MLLM)日益被用于自动化图表描述生成,一个关键问题随之而来:这些模型实际上如何忠实且有洞察力地描述图表?现有基准在两个方面不足:现有数据集包含简单、单一的图表,配以浅显、罗列事实的描述;且 prevailing 指标未能捕捉描述质量的多方面特性。为此,我们提出Chart Faithfulness and Insightfulness Benchmark (ChartFI-Bench)。我们首先概述四个特征,用于刻画高质量图表描述:事实准确性、显著特征突出、领域知识导向和图表-文本互补。基于这些特征,我们构建了一个高质量的基准,包含 896 对图表-描述配对,这些配对具有视觉复杂的图表和语义丰富的描述。此外,我们设计了四个对齐的评估指标——忠实性、覆盖率、信息量和敏锐度——用于系统性地评估这些特征上的描述质量。对主流 MLLM 的实验表明,所提框架有效且揭示了现有模型的常见弱点。
引用
@article{arxiv.2605.23694,
title = {ChartFI: Benchmarking Faithfulness and Insightfulness of Chart Descriptions from Multimodal Large Language Models},
author = {Fen Wang and Zekai Shao and Qiman Kang and Chunran Hu and Zhixuan Zhang and Lexu Xie and Chao Liu and Siming Chen},
journal= {arXiv preprint arXiv:2605.23694},
year = {2026}
}