中文

ChartHal:面向大视觉语言模型图表理解的细粒度幻觉评估框架

计算机视觉与模式识别 2025-09-23 v1 人工智能 计算与语言

摘要

大型视觉语言模型 (LVLMs) 近期取得显著进展,但幻觉仍是图表理解中的关键瓶颈,该任务要求模型具备 sophisticated 的感知与认知能力以及严格的事实准确性。虽然已有研究分别探讨过幻觉与图表理解,但其交叉领域鲜有涉及。为填补这一空白,我们提出 ChartHal,一个包含图表理解幻觉情景细粒度分类法及人类验证的 1,062 样本数据集的基准。我们的评估显示,最新 LVLMs 在 ChartHal 上幻觉严重,包括专有模型如 GPT-5 与 o4-mini,分别仅 achieving 34.46% 与 22.79% 的准确率。进一步分析表明,涉及图表中缺失或与图表矛盾信息的问题尤其容易诱发幻觉,凸显亟需更稳健的缓解策略。代码与数据已于 https://github.com/ymcui/ChartHal 提供。

关键词

引用

@article{arxiv.2509.17481,
  title  = {ChartHal: A Fine-grained Framework Evaluating Hallucination of Large Vision Language Models in Chart Understanding},
  author = {Xingqi Wang and Yiming Cui and Xin Yao and Shijin Wang and Guoping Hu and Xiaoyu Qin},
  journal= {arXiv preprint arXiv:2509.17481},
  year   = {2025}
}