中文

关于视觉语言模型进行图表理解的感知瓶颈

计算机视觉与模式识别 2025-09-26 v2 计算与语言

摘要

图表理解需要模型有效地分析和推理关于数值数据、文本元素和复杂视觉组件。我们注意到,现有大型视觉语言模型(LVLMs)的感知能力在此过程中构成关键瓶颈。本研究通过分解感知瓶颈来深入探讨其问题:视觉编码器瓶颈,视觉表示可能未能封装正确信息;以及提取瓶颈,语言模型难以从提供的视觉表示中提取必要信息。通过全面实验,我们发现:(1)视觉表示中嵌入的信息远比通常被线性提取器(如广泛使用的检索准确度指标)捕获的要丰富;(2)虽然指令调谐有效地增强了LVLMs的提取能力,但视觉编码器仍是关键瓶颈,需要重点关注和改进。因此,我们在对比学习框架下进一步增强了视觉编码器,以缓解视觉编码器瓶颈。实证结果表明,我们的方法显著缓解了感知瓶颈,提高了LVLMs理解图表的能力。代码已公开于https://github.com/hkust-nlp/Vision4Chart。

关键词

引用

@article{arxiv.2503.18435,
  title  = {On the Perception Bottleneck of VLMs for Chart Understanding},
  author = {Junteng Liu and Weihao Zeng and Xiwen Zhang and Yijun Wang and Zifei Shan and Junxian He},
  journal= {arXiv preprint arXiv:2503.18435},
  year   = {2025}
}

备注

EMNLP 2025: Camera-ready version