通过图像扰动视角重新审视多模态推理中的视觉理解
计算机视觉与模式识别
2025-09-30 v2 人工智能
摘要
尽管多模态大语言模型(MLLM)取得了快速进展,但它们在视觉处理方面 largely 被忽视。在一次简单而启发性的实验中,我们发现语言模型仅通过提供图像描述即可实现与或超过消费原始视觉输入的 MLLM 相当乃至更好的性能。这表明当前的 MLLM 可能生成准确的视觉描述,但在推理过程中未能有效整合它们。针对此现象,我们提出一种简单无需算法修改或额外训练数据的视觉扰动框架,以提升感知鲁棒性。我们的方法引入三种针对性扰动:干扰项拼接、支配保持混合,以及随机旋转,可轻松集成到包括 SFT、DPO 和 GRPO 在内的现有后训练管道。通过多个数据集上的大量实验,我们展示在数学推理任务中实现了一致的性能提升,提升幅度相当于通过算法变更所达到的。此外,我们通过在视觉扰动下训练 Qwen2.5-VL-7B,实现了开源 7B RL 调优模型中的竞争性能。通过全面消融研究,我们分析了不同扰动策略的有效性,发现每种扰动类型都独特地贡献于视觉推理的不同方面。我们的发现凸显了视觉扰动在多模态数学推理中的关键作用:更好的推理始于更好的感知。我们的代码已公开于 https://github.com/YutingLi0606/Vision-Matters。
引用
@article{arxiv.2506.09736,
title = {Revisiting Visual Understanding in Multimodal Reasoning through a Lens of Image Perturbation},
author = {Yuting Li and Lai Wei and Kaipeng Zheng and Jingyuan Huang and Guilin Li and Bo Wang and Linghe Kong and Lichao Sun and Weiran Huang},
journal= {arXiv preprint arXiv:2506.09736},
year = {2025}
}
备注
Technical Report