中文

用于统一多模态理解与生成的协同强化学习

计算机视觉与模式识别 2025-11-21 v3 计算与语言 多媒体

摘要

本文通过组相对策略优化对统一多模态大语言模型(ULMs)的强化学习(RL)进行了开创性探索,旨在同时强化生成和理解能力。通过系统的初步研究,我们揭示了ULMs在共享策略优化框架内实现双重能力协同演化的巨大潜力。基于这一洞察,我们提出了CoRL,一个协同强化学习框架,包含用于联合优化的统一RL阶段和用于任务特定增强的精细化RL阶段。通过提出的CoRL,我们得到的模型ULM-R1在三个文本到图像生成数据集上取得了平均7%的提升,在九个多模态理解基准上取得了23%的提升。这些结果展示了CoRL的有效性,并突显了强化学习在促进ULMs跨任务协同与优化方面的显著优势。代码可在https://github.com/mm-vl/ULM-R1获取。

关键词

引用

@article{arxiv.2505.17534,
  title  = {Co-Reinforcement Learning for Unified Multimodal Understanding and Generation},
  author = {Jingjing Jiang and Chongjie Si and Jun Luo and Hanwang Zhang and Chao Ma},
  journal= {arXiv preprint arXiv:2505.17534},
  year   = {2025}
}

备注

NeurIPS 2025