UniGen-1.5:通过强化学习中的奖励统一增强图像生成与编辑
计算机视觉与模式识别
2025-11-19 v1
摘要
我们提出UniGen-1.5,这是一个统一的多模态大语言模型(MLLM),用于先进的图像理解、生成和编辑。基于UniGen,我们全面增强了模型架构和训练管道,以强化图像理解和生成能力,同时解锁强大的图像编辑功能。尤其,我们提出了一种统一的强化学习(RL)策略,通过共享奖励模型联合改进图像生成和图像编辑。为进一步提升图像编辑性能,我们提出了轻量级的编辑指令对齐阶段,显著提高了编辑指令理解能力,这是RL训练成功的关键。实验结果表明,UniGen-1.5在图像理解和生成方面表现出竞争力。具体而言,UniGen-1.5在GenEval和ImgEdit上分别获得0.89和4.31的总体得分,超越了BAGEL等最先进模型,并接近专有模型如GPT-Image-1的性能。
引用
@article{arxiv.2511.14760,
title = {UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in Reinforcement Learning},
author = {Rui Tian and Mingfei Gao and Haiming Gang and Jiasen Lu and Zhe Gan and Yinfei Yang and Zuxuan Wu and Afshin Dehghan},
journal= {arXiv preprint arXiv:2511.14760},
year = {2025}
}