APO:通过非对称策略优化提升 MLLMs 推理能力
摘要
多模态大语言模型 (MLLMs) 在整合多样化数据方面具有强大能力,但常在复杂推理方面受限。 虽然强化学习 (RL) 可提升 LLM 的推理能力,但将其应用于 MLLMs 却颇具挑战性。 常见问题包括在通用任务上的性能下降以及生成过于详细的“过度思考”推理。 我们研究 KL 罚项和过度思考如何影响 MLLMs 的 RL 训练。 我们提出了非对称策略优化 (Asymmetric Policy Optimization, APO) 以解决这些问题,将采样响应分为正负两组。 对于正样本,引入难度自适应 KL 散度塑形 (Difficulty-Adaptive Divergence Shaping, DADS),根据样本难度动态调整 KL 散度权重。 该方法可防止策略熵急剧下降,提高训练稳定性,更好地利用样本,同时保留模型的现有知识。 对于负样本,提出次优轨迹复杂度正则化 (Suboptimal Trajectory Complexity Regularization, STCR),以惩罚过长的响应。 这有助于缓解过度思考,鼓励更简洁的推理,同时保留模型的探索能力。 我们将该方法应用于 Qwen2.5-VL-3B,创建了 View-R1-3B。 View-R1-3B 在推理能力上显著提升,在各种推理基准测试中相对于基础模型平均提升 7%,并在多种推理基准测试中超越更大的 MLLMs (7-11B)。 重要的是,与其他推理调优 MLLMs 常在通用任务上退化不同,View-R1-3B 保持一致的提升,显示出卓越的泛化能力。 这些结果凸显了 DADS 和 STCR 技术在推进复杂多模态推理方面的有效性和广泛适用性。 代码将在 https://github.com/Indolent-Kawhi/View-R1 上公开。
引用
@article{arxiv.2506.21655,
title = {APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization},
author = {Minjie Hong and Zirun Guo and Yan Xia and Zehan Wang and Ziang Zhang and Tao Jin and Zhou Zhao},
journal= {arXiv preprint arXiv:2506.21655},
year = {2025}
}