中文

为何视觉语言模型在视觉算术任务中难以胜任?面向图表与几何理解的提升方法

人工智能 2025-05-27 v3 计算与语言 计算机视觉与模式识别

摘要

视觉语言模型(Vision Language Models, VLMs)在多模态任务中取得了显著进展,但常在视觉算术方面受限,后者包括对象计数或长度比较等看似简单的能力,这些能力是图表理解和几何推理等相关复杂任务中必不可少的。本文首先通过一系列聚焦基础视觉算术的探针任务,探讨这一缺陷的根本原因。我们的分析表明,虽然预训练的视觉编码器通常能捕获足够的信息,但文本解码器在算术推理中往往无法正确解码这些信息。为此,我们提出了 CogAlign,一种受皮亚尼克认知发展理论启发的新型后训练策略。CogAlign 通过训练 VLMs 以识别在视觉变换下保持不变的属性,从而显著提升了三种多样化 VLMs 在本文提出的探针任务上的性能。进一步地,CogAlign 在 CHOCOLATE 和 MATH-VISION 上的平均性能分别提升了 4.6% 和 2.9%,虽仅需 60% 的训练数据,却超过或相当于监督微调方法。这些结果凸显了 CogAlign 在提升基础视觉算术能力及其对下游任务的迁移效果方面的有效性与通用性。

关键词

引用

@article{arxiv.2502.11492,
  title  = {Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding},
  author = {Kung-Hsiang Huang and Can Qin and Haoyi Qiu and Philippe Laban and Shafiq Joty and Caiming Xiong and Chien-Sheng Wu},
  journal= {arXiv preprint arXiv:2502.11492},
  year   = {2025}
}

备注

Code and data are available at https://github.com/SalesforceAIResearch/CogAlign