中文

Janus-Pro-R1:通过强化学习推进协同的视觉理解与生成

计算机视觉与模式识别 2025-10-22 v2

摘要

多模态大语言模型(MLLMs)领域的近期努力旨在统一视觉理解与生成。然而,这两种能力在很大程度上仍是独立的,仿佛是封装在同一模型内的两个独立功能。因此,视觉理解并未增强视觉生成,LLM 的推理机制也未被充分整合以彻底变革图像生成。在本文中,我们提出实现视觉理解与生成的协同共演化,将图像生成推进为一个迭代内省过程。我们引入了一种两阶段训练方法:监督微调赋予 MLLM 为视觉生成生成真正 CoT 的基础能力,而强化学习则通过探索-利用权衡激活其全部潜力。最终,我们解锁了视觉生成中的 Aha 时刻,将 MLLM 从文本到图像任务推进到统一图像生成。大量实验表明,我们的模型不仅在文本到图像生成和图像编辑方面表现出色,而且还能作为具有增强视觉理解能力的卓越图像语义评估器。项目页面:https://janus-pro-r1.github.io。

关键词

引用

@article{arxiv.2506.01480,
  title  = {Janus-Pro-R1: Advancing Collaborative Visual Comprehension and Generation via Reinforcement Learning},
  author = {Kaihang Pan and Yang Wu and Wendong Bu and Kai Shen and Juncheng Li and Yingting Wang and Yunfei Li and Siliang Tang and Jun Xiao and Fei Wu and Hang Zhao and Yueting Zhuang},
  journal= {arXiv preprint arXiv:2506.01480},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025