ChartCap:缓解稠密图表描述中的幻觉问题
计算机视觉与模式识别
2025-08-06 v1 人工智能
计算与语言
摘要
为视觉语言模型生成准确、信息丰富且无幻觉的图表描述仍具有挑战性,主要由于缺乏大规模高质量的真实世界图表数据集。然而,现有真实世界图表数据集存在包含无法从图表推断的冗余信息,以及未能充分捕捉结构要素和关键见解的缺陷。因此,我们引入ChartCap,这是一个包含56.5万张真实世界图表图像的数据集,配有类型特定的稠密描述,既不包含冗余信息,又详细突出结构要素和关键见解。为构建ChartCap,我们设计了一个四阶段流程,仅使用图表中可辨识的数据生成描述,并采用循环一致性进行人工验证,该流程在不牺牲准确性的前提下加速了质量控制。此外,我们提出了一种新型指标——视觉一致性得分,用于衡量描述质量,通过衡量从描述重新生成图表与原始图表的相似性来评估,独立于参考描述。大量实验表明,在ChartCap上微调的模型能够持续生成更准确、更具信息性的描述,并显著减少幻觉现象,超越了开源和专有模型,甚至人工标注的描述。
引用
@article{arxiv.2508.03164,
title = {ChartCap: Mitigating Hallucination of Dense Chart Captioning},
author = {Junyoung Lim and Jaewoo Ahn and Gunhee Kim},
journal= {arXiv preprint arXiv:2508.03164},
year = {2025}
}
备注
ICCV 2025 (Highlight)