中文

通过激活重放提升大型多模态模型的推理能力

计算机视觉与模式识别 2026-05-08 v3

摘要

最近,基于可验证奖励的强化学习 (RLVR) 作为激励大型多模态模型 (LMM) 推理能力的有效方法,但其背后机制仍鲜为人知。我们从 Logit 镜头的角度探讨输入激活如何被 RLVR 影响。我们通过多个后训练 LMM 的系统性调查表明,RLVR 对低熵激活的影响意外地较大,而高熵激活受到的影响较小。我们进一步通过受控实验表明,这种现象与 LMM 推理相关,暗示调制低熵激活可能具有积极作用。为此,我们提出激活重放 (Activation Replay),一种简单而有效的无需昂贵策略优化的后训练 LMM 推理提升方法。我们的设计涉及对视觉标记的操控,在测试时将来自基础 LMM 输入上下文中低熵激活的重放,以调节 RLVR 版本。激活重放在包括数学、o3 类视觉代理和视频推理等多种场景中触发更好的推理。在我们进一步表明激活重放提升了 Pass@K 指标并缓解了 RLVR 的较窄推理覆盖范围。我们与替代选择进行了比较,包括重放高熵激活或直接进行跨模型干预而非操控输入标记,结果显示我们的实现优势更明显。代码已公开于 https://github.com/latentcraft/replay。

关键词

引用

@article{arxiv.2511.19972,
  title  = {Boosting Reasoning in Large Multimodal Models via Activation Replay},
  author = {Yun Xing and Xiaobin Hu and Qingdong He and Jiangning Zhang and Shuicheng Yan and Shijian Lu and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2511.19972},
  year   = {2026}
}

备注

CVPR 2026