中文

Skywork UniPic 2.0:利用在线强化学习构建统一多模态模型的 Kontext 模型

计算机视觉与模式识别 2026-01-23 v2

摘要

多模态模型的最新进展在统一图像生成与编辑方面展现了令人瞩目的能力。然而,许多著名的开源模型优先考虑扩大模型参数规模,而非优化训练策略,这限制了其效率和性能。在本工作中,我们提出了 UniPic2-SD3.5M-Kontext,一种基于 SD3.5-Medium 的 2B 参数 DiT 模型,它实现了最先进的图像生成与编辑,并无缝扩展至统一的多模态框架。我们的方法首先对 SD3.5-Medium 进行架构修改,并在高质量数据上进行大规模预训练,从而实现文本到图像的联合生成与编辑能力。为了增强指令遵循和编辑一致性,我们提出了一种新颖的渐进式双任务强化策略(Progressive Dual-Task Reinforcement, PDTR),以分阶段的方式有效加强这两项任务。我们通过实验验证了不同任务的强化阶段是互利的,且不会引起负向干扰。经过预训练和强化策略后,UniPic2-SD3.5M-Kontext 展现出比具有显著更大生成参数的模型(包括 BAGEL (7B) 和 Flux-Kontext (12B))更强的图像生成和编辑能力。此外,遵循 MetaQuery,我们通过连接器将 UniPic2-SD3.5M-Kontext 和 Qwen2.5-VL-7B 连接起来,并进行联合训练,推出了统一的多模态模型 UniPic2-Metaquery。UniPic2-Metaquery 集成了理解、生成和编辑功能,以简单且可扩展的训练范式在各种任务中取得了顶尖性能。这持续验证了我们提出的训练范式的有效性和泛化能力,我们将其正式命名为 Skywork UniPic 2.0。

关键词

引用

@article{arxiv.2509.04548,
  title  = {Skywork UniPic 2.0: Building Kontext Model with Online RL for Unified Multimodal Model},
  author = {Hongyang Wei and Baixin Xu and Hongbo Liu and Size Wu and Jie Liu and Yi Peng and Peiyu Wang and Zexiang Liu and Jingwen He and Yidan Xietian and Chuanxin Tang and Zidong Wang and Yichen Wei and Liang Hu and Boyi Jiang and Wei Li and Ying He and Yang Liu and Xuchen Song and Yangguang Li and Yahui Zhou},
  journal= {arXiv preprint arXiv:2509.04548},
  year   = {2026}
}