多模态生成式 AI:多模态 LLMs、扩散模型与统一
人工智能
2025-11-26 v3 计算机视觉与模式识别
摘要
多模态生成式人工智能(AI)正获得来自学术界和产业界的日益关注。特别是,两大技术家族已涌现:i) 多模态大型语言模型(LLMs)在多模态理解方面展现出惊人的能力;ii) 扩散模型在多模态生成方面展现出卓越的能力。因此,本文提供了多模态生成式 AI 的综合概述,包括多模态 LLMs、扩散模型以及用于理解和生成的统一。为了为统一模型奠定坚实的基础,我们首先分别详细回顾了多模态 LLMs 和扩散模型,包括其概率建模过程、多模态架构设计以及针对图像/视频 LLMs 以及文本到图像/视频生成的高级应用。进一步地,我们探索了向统一模型(用于理解和生成)的新兴努力。为实现理解和生成的统一,我们研究了关键设计,包括基于自回归的建模、基于扩散的建模,以及稠密和混合专家(MoE)架构。我们 then 介绍了几种统一模型的策略,分析了其潜在优势和不足。此外,我们总结了用于多模态生成式 AI 预训练的常见数据集。最后,我们呈现了几个具有挑战性的未来研究方向,这些方向可能为持续推动多模态生成式 AI 的进步做出贡献。
引用
@article{arxiv.2409.14993,
title = {Multi-modal Generative AI: Multi-modal LLMs, Diffusions, and the Unification},
author = {Xin Wang and Yuwei Zhou and Bin Huang and Hong Chen and Wenwu Zhu},
journal= {arXiv preprint arXiv:2409.14993},
year = {2025}
}
备注
21 pages, 10 figures, 3 tables