中文

UniGen-1.5:通过强化学习中的奖励统一增强图像生成与编辑

计算机视觉与模式识别 2025-11-19 v1

摘要

我们提出UniGen-1.5,这是一个统一的多模态大语言模型(MLLM),用于先进的图像理解、生成和编辑。基于UniGen,我们全面增强了模型架构和训练管道,以强化图像理解和生成能力,同时解锁强大的图像编辑功能。尤其,我们提出了一种统一的强化学习(RL)策略,通过共享奖励模型联合改进图像生成和图像编辑。为进一步提升图像编辑性能,我们提出了轻量级的编辑指令对齐阶段,显著提高了编辑指令理解能力,这是RL训练成功的关键。实验结果表明,UniGen-1.5在图像理解和生成方面表现出竞争力。具体而言,UniGen-1.5在GenEval和ImgEdit上分别获得0.89和4.31的总体得分,超越了BAGEL等最先进模型,并接近专有模型如GPT-Image-1的性能。

关键词

引用

@article{arxiv.2511.14760,
  title  = {UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in Reinforcement Learning},
  author = {Rui Tian and Mingfei Gao and Haiming Gang and Jiasen Lu and Zhe Gan and Yinfei Yang and Zuxuan Wu and Afshin Dehghan},
  journal= {arXiv preprint arXiv:2511.14760},
  year   = {2025}
}