从视觉推理到洞察:通过强化学习提升多模态模型的视觉推理能力
计算机视觉与模式识别
2026-01-05 v1 计算与语言
摘要
强化学习(RL)已成为在生成最终答案前激发推理链的有前景方法。然而,多模态大语言模型(MLLMs)生成的推理缺乏对视觉信息的整合,这限制了其解决需要精准视觉感知问题(如视觉拼图)的能力。我们发现视觉感知是此类任务的关键瓶颈:将图像转换为文本描述可显著提升性能,Claude 3.5 提升了26.7%,Claude 3.7 提升了23.6%。为此,我们研究在不要求高成本监督的情况下,使用奖励驱动的 RL 作为激发开源 MLLMs 中长视觉推理的机制。我们设计并评估了六种针对不同推理方面的奖励函数,包括图像理解、思考步骤和答案准确性。采用分组相对策略优化(GRPO),我们的方法显式激励更长的结构化推理,并缓解了绕过视觉信息的问题。以 Qwen-2.5-VL-7B 为例,在基线模型上实现了5.56%的提升,在两种域内和域外设置中均表现出一致的 gains。
引用
@article{arxiv.2601.00215,
title = {From Sight to Insight: Improving Visual Reasoning Capabilities of Multimodal Models via Reinforcement Learning},
author = {Omar Sharif and Eftekhar Hossain and Patrick Ng},
journal= {arXiv preprint arXiv:2601.00215},
year = {2026}
}
备注
23 pages, 15 Figures, 10 Tables