通过差分视觉推理策略激励强化学习
人工智能
2026-01-13 v1 机器学习
摘要
基于可验证奖励的强化学习(RLVR)已显著提升了大型语言模型中的推理能力。然而,将RLVR应用于多模态领域时,面临一个关键的“感知-推理脱钩”问题。现有范式受文本导向的结果奖励驱动,推理过程也在语言层面进行,本质上会鼓励模型绕过视觉感知。我们通过盲实验验证了这一点:最先进的策略在视觉输入被完全移除后仍能维持或出乎意料地改善性能。这表明这些模型退化为“盲推理者”,通过利用语言先验在没有注意视觉证据的情况下生成合理的答案。为此,我们提出了“Thinking with Deltas”框架,由“差分视觉推理策略”(Differential Visual Reasoning Policy, DVRP)驱动。DVRP通过视觉三元组引入内在监督,包括原始输入、被遮盖输入和扰动输入。它优化模型,以最大化相对于遮盖输入的推理发散(强制“视觉敏感性”),同时最小化相对于扰动输入的发散(确保“视觉鲁棒性”)。通过将推理变化严格地与视觉信息的“Delta”对齐,DVRP本质上增强了视觉理解能力,并在无需外部标注或辅助工具的情况下,在通用和医疗基准测试中显著优于最先进的方法。
引用
@article{arxiv.2601.06801,
title = {Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy},
author = {Shujian Gao and Yuan Wang and Jiangtao Yan and Zuxuan Wu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2601.06801},
year = {2026}
}
备注
24 pages, 10 tables, 4 figures