中文

睁开眼睛再思考:多模态大语言模型中的细粒度视觉数学理解

计算机视觉与模式识别 2025-01-14 v1

摘要

当前多模态大语言模型(MLLM)在需要细粒度视觉理解的数学问题解决任务中表现不佳。其限制主要归因于在图像级对比预训练(如 CLIP)期间对几何原语的感知不足。虽然最近的改进措施聚焦于扩大数学视觉指令数据集并采用更强大的 LLM 底层架构,但常常忽视了视觉识别中的持久性错误。在本文中,我们系统评估了最新 MLLM 的视觉 grounding 能力,发现视觉 grounding 准确率与问题解决性能之间存在显著负相关性,凸显了细粒度视觉理解的关键作用。值得注意的是,像 GPT-4o 这样的高级模型在识别几何实体时会出现 70% 的错误率,表明这仍是视觉数学推理中的关键瓶颈。为此,我们提出一种新方法,SVE-Math(Selective Vision-Enhanced Mathematical MLLM),其特点是具备几何 grounding 的视觉编码器和 feature router,能够动态调整各层次视觉特征图的贡献。我们的模型准确识别视觉原语,并生成针对语言模型推理需求的精确视觉提示。在实验中,SVE-Math-Qwen2.5-7B 在 MathVerse 上超越其他 7B 模型 15% ,并在 MathVista 上与 GPT-4V 兼容。尽管使用的数据集较小,SVE-Math-7B 仍在 GeoQA 上实现竞争性能,与在显著更大数据集上训练的模型不相上下。我们的发现强调了将细粒度视觉理解纳入 MLLM 的重要性,并为未来研究提供了有前景的方向。

关键词

引用

@article{arxiv.2501.06430,
  title  = {Open Eyes, Then Reason: Fine-grained Visual Mathematical Understanding in MLLMs},
  author = {Shan Zhang and Aotian Chen and Yanpeng Sun and Jindong Gu and Yi-Yu Zheng and Piotr Koniusz and Kai Zou and Anton van den Hengel and Yuan Xue},
  journal= {arXiv preprint arXiv:2501.06430},
  year   = {2025}
}