强化多模态推理抵御视觉退化
计算机视觉与模式识别
2026-05-12 v1 计算与语言
摘要
强化学习已显著提升了多模态大语言模型(MLLMs)的推理能力,但所获得的策略在面对模糊、压缩伪影和低分辨率扫描等实际视觉退化时仍显脆弱。先前的鲁棒性技术来自视觉和深度强化学习,依赖静态数据增强或基于价值的正则化,这些方法对自回归 MLLM 的无评论家强化微调几乎不 transfer。对抗此类退化的推理并非易事:若在 rollout 时直接注入退化视图,会导致奖励中毒,感知遮挡会触发幻觉轨迹并 destabilize 优化。我们提出 ROMA(Reinforcing Multimodal Reasoning Against Visual Degradation),一个强化微调框架,通过修改优化动力学来强化视觉退化下的推理,同时保持干净输入性能。采用双前向传递策略利用 teacher forcing 对退化视图进行评估,避免在退化输入上进行新 rollout。为保证分布一致性,对最坏情况数据增强应用 token 级 surrogate KL 惩罚;为防止正则化导致策略崩溃,引入以干净图像优势为锚的辅助策略梯度损失,保留可靠奖励信号;为避免系统性错误的不变性,正确性条件化正则化仅针对成功轨迹实施约束。在 Qwen3-VL 4B/8B 上的七个多模态推理基准测试中,我们的方法在见过的退化上提升 +2.4%,在未见过的退化上提升 +2.3%,且保持干净准确率。
引用
@article{arxiv.2605.09262,
title = {Reinforcing Multimodal Reasoning Against Visual Degradation},
author = {Rui Liu and Dian Yu and Haolin Liu and Yucheng Shi and Tong Zheng and Runpeng Dai and Haitao Mi and Pratap Tokekar and Leoweiliang},
journal= {arXiv preprint arXiv:2605.09262},
year = {2026}
}