通过动态记忆与探索赋能小型视觉语言模型进行思考
计算机视觉与模式识别
2026-03-02 v2
摘要
小型视觉语言模型(SVLMs)非常适合专有任务。赋予它们思考能力是提升其在这些特定领域中的性能和可靠性的关键步骤。然而,现有的训练范式,包括监督微调(SFT)和带可验证奖励的强化学习(RLVR),对基础 VLM 提出了超出 SVLMs 能力的极高要求。因此,直接将这些范式应用于 SVLMs 无法赋予所期望的思考能力。一个自然的解决方案是结合 SFT 和 RLVR,利用它们的互补性来降低对模型容量的依赖。然而核心挑战在于管理固有的权衡:过度依赖 SFT 会迫使模型记忆伪思考轨迹,而过度强调 RLVR 会导致不稳定的探索(即优势崩溃)。为了解决这个问题,我们提出了 DyME,一种在每次优化步骤中动态选择记忆(通过 SFT)和探索(通过 RLVR)的新颖训练范式。通过确保每次更新都有助于这种权衡,DyME 作为一种稳健的独立策略来稳定 SVLM 的学习。作为该范式的补充,我们进一步引入了一种协同视觉监督机制(包含视觉检查器和细化器),旨在优化过程中注入动态增强的、基于图像的指导。跨多个领域的广泛实验表明,DyME 始终能够实现这种平衡,从而在专门任务上带来显著的性能提升。这些结果确立了 DyME 作为赋能 SVLMs 具备可靠思考能力的实用且有效的解决方案。GitHub: https://github.com/HKUST-LongGroup/DyME
引用
@article{arxiv.2506.23061,
title = {Empowering Small VLMs to Think with Dynamic Memorization and Exploration},
author = {Jiazhen Liu and Yuchuan Deng and Long Chen},
journal= {arXiv preprint arXiv:2506.23061},
year = {2026}
}
备注
Accepted by ICLR 2026