ChartDiff:用于理解图表对的大规模基准
人工智能
2026-05-12 v2
摘要
图表是分析推理的核心内容,但现有基准几乎只关注单张图表的理解,而非跨多张图表的比较推理。为填补这一空白,我们引入ChartDiff——首个针对跨图表比较总结的数据集。ChartDiff包含8,541对图表,涵盖多样数据来源、图表类型和视觉样式,每对图表均标注了LLM生成并经人工验证的摘要,描述趋势、波动和异常的差异。我们使用ChartDiff评估通用模型、图表专用模型和管道式模型。结果显示,前沿通用模型获得最高的GPT基准质量得分,而专用和管道式方法获得更高的ROUGE分数但较低的人类对齐评估,揭示了词汇重合与实际摘要质量之间的明显差距。我们进一步发现,多系列图表在各类模型中仍具挑战性,而强大的端到端模型对绘图库差异较为稳健。总体而言,我们的发现表明,比较图表理解仍是当前视觉语言模型面临的重大挑战,并将ChartDiff定位为推动多图理解研究的新基准。
引用
@article{arxiv.2603.28902,
title = {ChartDiff: A Large-Scale Benchmark for Comprehending Pairs of Charts},
author = {Rongtian Ye},
journal= {arXiv preprint arXiv:2603.28902},
year = {2026}
}
备注
21 pages, 17 figures, accepted to ACL 2026: the 4th Workshop on Advances in Language and Vision Research