失去情节:VLM 在不完美图表上的响应性能下降
计算机视觉与模式识别
2025-09-24 v1
摘要
视觉语言模型(VLMs)在图表理解方面表现出色,但现有基准假设干净的图表和基于事实的查询。真实世界的图表常常包含扭曲,要求超出简单匹配的推理。我们评估了 ChatGPT 4o、Claude Sonnet 4 和 Gemini 2.5 Pro,发现在扭曲或遮挡情况下性能显著下降,出现价值虚构、趋势误解和实体混淆等幻觉现象更频繁。模型在受损设置下仍显得过于自信,生成看似合理但缺乏支持的解释。为弥合这一差距,我们引入了 CHART NOISe(Chart Hallucinations, Answers, and Reasoning Testing on Noisy and Occluded Input Selections),该数据集组合了图表扭曲、遮挡以及受韩国 CSAT 英语部分启发的考试式多选题。一个关键创新是提示逆向不一致,即模型在被要求确认与否认同一陈述时会自相矛盾。我们的贡献有三方面:(1)基准测试最先进的 VLMs,暴露出图表推理中的系统性漏洞;(2)发布 CHART NOISe,这是首个统一扭曲、遮挡和逆向不一致的数据集;(3)提出基线缓解策略,如质量过滤和遮挡检测。通过这些努力,建立了严密的测试基准,以推动图表理解的鲁棒性和可靠性。
关键词
引用
@article{arxiv.2509.18425,
title = {Losing the Plot: How VLM responses degrade on imperfect charts},
author = {Philip Wootaek Shin and Jack Sampson and Vijaykrishnan Narayanan and Andres Marquez and Mahantesh Halappanavar},
journal= {arXiv preprint arXiv:2509.18425},
year = {2025}
}