视觉模态在多模态数学推理中的作用:挑战与洞见
计算机视觉与模式识别
2025-06-05 v2 人工智能
摘要
近期研究越来越多地关注多模态数学推理,特别是强调创建相关的数据集和基准。尽管如此,视觉信息在推理中的作用一直未被充分探索。我们的发现表明,现有的多模态数学模型极少利用视觉信息,模型性能在数据集中的图像被更改或移除时基本不受影响。我们将此归因于文本信息和答案选项的主导地位,这些信息无意中引导模型得出正确答案。为了改进评估方法,我们引入了HC-M3D数据集,专门设计为需要依赖图像来解决问题,并以相似但不同的图像来挑战模型,这些图像会改变正确答案。在测试前沿模型时,它们未能检测到这些细微的视觉差异,表明当前视觉感知能力存在局限性。此外,我们观察到通过组合多种类型的图像编码器来提升通用视觉问答能力的方法对数学推理性能没有贡献。这一发现也对增强数学推理期间的视觉依赖性提出了挑战。我们的基准和代码将在https://github.com/Yufang-Liu/visual_modality_role上提供。
引用
@article{arxiv.2503.04167,
title = {The Role of Visual Modality in Multimodal Mathematical Reasoning: Challenges and Insights},
author = {Yufang Liu and Yao Du and Tao Ji and Jianing Wang and Yang Liu and Yuanbin Wu and Aimin Zhou and Mengdi Zhang and Xunliang Cai},
journal= {arXiv preprint arXiv:2503.04167},
year = {2025}
}