中文

论功行赏:跨模态连接驱动多模态大语言模型推理的精准强化学习

人工智能 2026-02-13 v1

摘要

基于可验证奖励的强化学习(RLVR)显著提升了多模态大语言模型(MLLM)的推理能力,然而,视觉证据在推理过程中如何被整合仍知之甚少。我们通过跨模态注意力连接的视角探索多模态RLVR,发现仅有少量token(约15%)表现出强烈的视觉-文本耦合。这些高连接性token充当锚点,将推理锚定在图像上,而大多数token则遵循语言模式。在RLVR训练过程中,信用分配自然地集中在这些锚点上,随着时间推移,其视觉锚定能力不断增强。基于这一发现,我们提出了锚点Token强化学习(AT-RL),这是一个轻量级框架,通过基于图的注意力拓扑聚类,选择性地增强高连接性token。在系列模型(3B-32B)上的评估表明,AT-RL仅引入1.2%的开销,却使32B模型在MathVista上超越了72B-Instruct基线(80.2),并在STEM、视频和通用任务上均取得了一致的性能提升。相反,仅对低连接性token进行训练会导致性能严重下降,这证实了有效的多模态RL依赖于对视觉锚点的精准信用分配。我们的工作揭示了推理质量并非由token数量决定,而是由跨模态锚定的保真度所支配。

关键词

引用

@article{arxiv.2602.11455,
  title  = {Credit Where It is Due: Cross-Modality Connectivity Drives Precise Reinforcement Learning for MLLM Reasoning},
  author = {Zhengbo Jiao and Shaobo Wang and Zifan Zhang and Wei Wang and Bing Zhao and Hu Wei and Linfeng Zhang},
  journal= {arXiv preprint arXiv:2602.11455},
  year   = {2026}
}

备注

20pages