中文

MMGen:统一的多模态图像生成与理解框架

计算机视觉与模式识别 2025-03-27 v1

摘要

统一的扩散框架用于多模态生成和理解具有变革性潜力,可实现无缝且可控的图像扩散及其他跨模态任务。本文引入了 MMGen,一个将多个生成任务整合到单个扩散模型中的统一框架。这包括:(1)多模态类别条件生成,通过单次推理过程生成给定类别信息下的多模态输出;(2)多模态视觉理解,从 RGB 图像准确预测深度、表面法线和分割图;(3)多模态条件生成,根据特定模态条件和其他对齐模态生成对应的 RGB 图像。我们的方法开发了一种新颖的扩散转换器,灵活支持多模态输出,同时采用简单的方法解耦模态,以统一各种任务。广泛的实验和应用表明,MMGen 在多样化任务和条件下均表现出色,凸显了其在需要同时进行生成和理解的场景中的潜力。

关键词

引用

@article{arxiv.2503.20644,
  title  = {MMGen: Unified Multi-modal Image Generation and Understanding in One Go},
  author = {Jiepeng Wang and Zhaoqing Wang and Hao Pan and Yuan Liu and Dongdong Yu and Changhu Wang and Wenping Wang},
  journal= {arXiv preprint arXiv:2503.20644},
  year   = {2025}
}

备注

Our project page: https://jiepengwang.github.io/MMGen/