用于多模态推理的混合策略RLVR中的可控探索
机器学习
2026-03-13 v2 人工智能
摘要
基于可验证奖励的强化学习( RLVR) 已成为增强多模态大语言模型( MLLM)推理能力的主要学习范式。然而,在RL训练过程中,MLLM的庞大状态空间和稀疏奖励常导致熵崩溃、策略退化或过度依赖次优行为。这使得需要一种在保持生产性随机性的同时避免不可控随机抽样缺陷,实现高效探索的策略。本文提出了 CalibRL,一种支持可控探索的混合策略 RLVR 框架,借助专家指导实现。首先,一种基于分布的优势加权按组稀有性对更新进行比例缩放,以校准分布,从而保持探索。同时,采用不对称激活函数( LeakyReLU) 利用专家知识作为校准基准,以调节过度自信的更新,同时保留其纠正方向。CalibRL 以受引导的方式增加策略熵,并通过在线抽样估计模型策略的 on-policy 分布来阐明目标分布。这些具有信息性的行为驱动更新,避免收敛到错误模式。重要的是,这些设计有助于缓解模型策略与专家轨迹之间的分布性不匹配,从而实现探索与开发的更稳定的平衡。广泛的实验覆盖八个基准测试,包括内域和外域设置,均表现出一致的改进,验证了可控混合策略 RLVR 训练的有效性。代码已公开于 https://github.com/zhh6425/CalibRL。
引用
@article{arxiv.2602.20197,
title = {Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning},
author = {Zhuoxu Huang and Mengxi Jia and Hao Sun and Xuelong Li and Jungong Han},
journal= {arXiv preprint arXiv:2602.20197},
year = {2026}
}
备注
Published as a conference paper at ICLR 2026