中文

UniRL:通过监督学习与强化学习的自改进统一多模态模型

计算机视觉与模式识别 2025-05-30 v1

摘要

诸如 Show-o 和 Janus 的统一多模态大语言模型在生成与理解任务上均取得了优异的性能。然而,这些模型通常依赖大规模数据集,并在预训练阶段需要大量计算。此外,已有多种后训练方法被提出,但它们往往依赖外部数据或局限于特定任务的定制。在本工作中,我们提出了 UniRL,一种自改进的后训练方法。我们的方法使模型能够在每次迭代中根据提示生成图像并将其用作训练数据,而无需依赖任何外部图像数据。此外,它使两项任务能够相互增强:生成的图像用于理解,而理解的结果用于监督生成。我们探索了监督微调(SFT)和群组相对策略优化(GRPO)来优化模型。UniRL 具有三个关键优势:(1)不需要外部图像数据,因为所有训练样本均由模型在训练过程中自行生成;(2)不仅提升了单个任务的性能,还减少了生成与理解之间的不平衡;(3)在后训练阶段仅需少量额外的训练步数。我们在 Show-o 和 Janus 的基础上评估了 UniRL,Show-o 的 GenEval 得分为 0.77,Janus 为 0.65。代码和模型将发布于 https://github.com/showlab/UniRL。

关键词

引用

@article{arxiv.2505.23380,
  title  = {UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning},
  author = {Weijia Mao and Zhenheng Yang and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2505.23380},
  year   = {2025}
}