推理可携带性:在 RLVR 时代指导 MLLMs 持续学习
机器学习
2026-05-20 v1 计算机视觉与模式识别
摘要
视觉语言模型在持续学习(VLM-CL)中旨在在保持先前知识的同时,持续适应新的多模态任务。将多模态大语言模型(MLLMs)与可验证奖励强化学习(RLVR)耦合的新兴范式,要求一种新的模式来指导持续适应。推理能力的进步使得在推理层面施加约束变得可行。我们在样本层面 formalize 推理可携带性,这是指先前策略的行为在新任务上的可重用性程度的度量,并经验性地表明,推理层面的信号在分布外样本上保持可靠,而答案层面的信号则不然。我们将其实现为推理可携带性(Reasoning Portability, RP),并提出基于推理的动态平衡持续学习(RDB-CL),该方法根据 RP 调整 RLVR 中每个样本的克隆-氏信息 regularization:在高 RP 样本上使用紧密锚点以保持可重用的推理,在低 RP 样本上使用放宽锚点以允许探索新的推理路径。实验表明,RDB-CL 在基线上 consistently 优于,使最后准确率提升 12.0%。
引用
@article{arxiv.2605.18903,
title = {Reasoning Portability: Guiding Continual Learning for MLLMs in the RLVR Era},
author = {Qiuhe Hong and Yuyang Liu and Shuo Yang and Tiantian Peng and Fei Zhu and Yonghong Tian},
journal= {arXiv preprint arXiv:2605.18903},
year = {2026}
}