中文

条条大路通罗马:激励视觉语言模型中的发散思维

计算机视觉与模式识别 2026-04-02 v1

摘要

近期研究表明,强化学习(RL),特别是组相对策略优化(GRPO),可以内在地激发并增强视觉语言模型(VLM)的推理能力。然而,尽管前景广阔,驱动RL模型有效性的底层机制及其局限性仍未被充分探索。本文中,我们强调了RL模型与基础模型之间一个根本的行为差异:前者进行更深但更窄的推理,而基础模型尽管沿单一路径不够精细,却展现出更广泛和更多样的思维模式。通过对训练动态的进一步分析,我们表明GRPO容易发生多样性崩溃,导致模型过早收敛到有限的一组推理策略,而丢弃了大多数潜在替代方案,从而导致局部最优和较差的扩展性。为解决此问题,我们提出多组策略优化(MUPO),一种简单而有效的方法,旨在激励跨多个解决方案的发散思维,并在已建立的基准上证明了其有效性。项目页面:https://xytian1008.github.io/MUPO/

关键词

引用

@article{arxiv.2604.00479,
  title  = {All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models},
  author = {Xinyu Tian and Shu Zou and Zhaoyuan Yang and Mengqi He and Peter Tu and Jing Zhang},
  journal= {arXiv preprint arXiv:2604.00479},
  year   = {2026}
}

备注

Accepted to CVPR2026