中文

VL-Cogito:面向高级多模态推理的渐进式课程强化学习

计算机视觉与模式识别 2025-08-01 v2 人工智能 计算与语言

摘要

强化学习已被证明在增强大语言模型的推理能力方面是有效的。最近的研究工作已逐步将此范式扩展到多模态推理任务。由于多模态任务固有的复杂性和多样性,特别是在语义内容和问题形式方面,现有模型在不同领域和难度级别上往往表现出不稳定的性能。为了解决这些局限性,我们提出了VL-Cogito,一个通过新颖的多阶段渐进式课程强化学习(PCuRL)框架训练的高级多模态推理模型。PCuRL系统地引导模型完成难度逐渐增加的任务,从而显著提升其在多样化多模态环境中的推理能力。该框架引入了两项关键创新:(1)在线难度软加权机制,在连续的强化学习训练阶段动态调整训练难度;(2)动态长度奖励机制,鼓励模型根据任务复杂度自适应地调节其推理路径长度,从而平衡推理效率与正确性。实验评估表明,VL-Cogito在涵盖数学、科学、逻辑和通用理解的主流多模态基准测试中,始终达到或超越现有的面向推理的模型,验证了我们方法的有效性。

关键词

引用

@article{arxiv.2507.22607,
  title  = {VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning},
  author = {Ruifeng Yuan and Chenghao Xiao and Sicong Leng and Jianyu Wang and Long Li and Weiwen Xu and Hou Pong Chan and Deli Zhao and Tingyang Xu and Zhongyu Wei and Hao Zhang and Yu Rong},
  journal= {arXiv preprint arXiv:2507.22607},
  year   = {2025}
}

备注

21 pages, 5 figures, 6 tables. Work in progress