中文

统一多模态理解与生成模型:进展、挑战与机遇

计算机视觉与模式识别 2026-01-27 v6

摘要

近年来,多模态理解模型和图像生成模型都取得了显著进展。尽管它们各自取得了成功,但这两个领域一直是独立发展的,导致了截然不同的架构范式:自回归架构主导了多模态理解,而扩散模型已成为图像生成的基石。最近,人们对开发整合这些任务的统一框架的兴趣日益增长。GPT-4o 新功能的出现就是这一趋势的例证,凸显了统一的潜力。然而,两个领域之间的架构差异带来了重大挑战。为了清晰地概述当前统一化的努力,我们提供了一份全面的综述,旨在指导未来的研究。首先,我们介绍了多模态理解和文本到图像生成模型的基础概念及最新进展。其次,我们回顾了现有的统一模型,将它们分为三种主要的架构范式:基于扩散的、基于自回归的以及融合自回归和扩散机制的混合方法。对于每个类别,我们分析了相关工作的结构设计和创新之处。此外,我们还整理了为统一模型量身定制的数据集和基准,为未来的探索提供资源。最后,我们讨论了这一新兴领域面临的关键挑战,包括分词策略、跨模态注意力和数据。由于该领域仍处于早期阶段,我们预计将会有快速进展,并将定期更新本综述。我们的目标是激发进一步的研究,并为社区提供有价值的参考。与本综述相关的参考文献可在 GitHub 上获取 (https://github.com/AIDC-AI/Awesome-Unified-Multimodal-Models)。

关键词

引用

@article{arxiv.2505.02567,
  title  = {Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities},
  author = {Shanshan Zhao and Xinjie Zhang and Jintao Guo and Jiakui Hu and Lunhao Duan and Minghao Fu and Yong Xien Chng and Guo-Hua Wang and Qing-Guo Chen and Zhao Xu and Weihua Luo and Kaifu Zhang},
  journal= {arXiv preprint arXiv:2505.02567},
  year   = {2026}
}

备注

In this version, we incorporate new papers (after Aug. 2025), datasets, and benchmarks. This work is still in progress; Github project: https://github.com/AIDC-AI/Awesome-Unified-Multimodal-Models