统一多模态离散扩散
计算机视觉与模式识别
2025-03-28 v1 人工智能
机器学习
机器人学
摘要
多模态生成模型能够理解和生成图像、文本、视频和音频等多种模态,主流采用自回归(AR)方法,按顺序从左到右或从上到下处理token。这些模型用于图像描述、问答和图像生成等任务。本文探索离散扩散模型作为联合文本和图像领域的统一生成框架,延续其在文本生成领域的近期成功。离散扩散模型相较于AR模型具有多个优势:可更好地控制生成样本的质量与多样性,可实现联合多模态inpainting(跨文本和图像域),以及通过guidance实现更大的可控性。基于这些优势,我们提出首个统一多模态离散扩散(UniDisc)模型,能够为各种下游任务 jointly 理解和生成文本和图像。我们将UniDisc与多模态AR模型进行比较,通过规模化分析表明UniDisc在性能和推理计算、可控性、可编辑性、inpainting以及推理时间与生成质量之间灵活权衡方面均优于AR模型。代码和额外可视化已提供,访问 https://unidisc.github.io。
引用
@article{arxiv.2503.20853,
title = {Unified Multimodal Discrete Diffusion},
author = {Alexander Swerdlow and Mihir Prabhudesai and Siddharth Gandhi and Deepak Pathak and Katerina Fragkiadaki},
journal= {arXiv preprint arXiv:2503.20853},
year = {2025}
}
备注
Project Website: https://unidisc.github.io