中文

UniVG:通用图像生成与编辑的通用扩散模型

计算机视觉与模式识别 2025-04-24 v2

摘要

文本到图像(T2I)扩散模型已在生成遵循用户提示的视觉精彩图像方面取得显著成果。基于此,各种方法进一步对预训练的T2I模型进行特定任务的微调。然而,这需要多个模型架构、训练设计和多个参数集合来处理不同任务。本文引入UniVG,一个能够支持多样化图像生成任务的通用扩散模型,仅凭一组权重即可。UniVG将多模态输入视为统一条件,以支持多种下游应用,涵盖T2I生成、图像填充、指令式编辑、身份保持生成、布局引导生成、深度估计和指代分割。通过对数据混合和多任务训练进行全面实证研究,我们提供了关于训练过程和决策的详细见解。例如,我们表明T2I生成与其他任务(如指令式编辑)可以无需性能权衡地共存,同时辅助任务(如深度估计和指代分割)可提升图像编辑效果。值得注意的是,我们的模型甚至能在各自基准上超越一些任务特定模型,标志着向统一图像生成模型迈出的重要一步。

关键词

引用

@article{arxiv.2503.12652,
  title  = {UniVG: A Generalist Diffusion Model for Unified Image Generation and Editing},
  author = {Tsu-Jui Fu and Yusu Qian and Chen Chen and Wenze Hu and Zhe Gan and Yinfei Yang},
  journal= {arXiv preprint arXiv:2503.12652},
  year   = {2025}
}