DART:面向可扩展文本到图像生成的去噪自回归Transformer
计算机视觉与模式识别
2025-01-24 v2 机器学习
摘要
扩散模型已成为视觉生成的主流方法。它们通过去噪一个马尔可夫过程来训练,该过程逐渐向输入添加噪声。我们认为马尔可夫性质限制了模型充分利用生成轨迹的能力,导致训练和推理效率低下。在本文中,我们提出DART,一种基于Transformer的模型,它在非马尔可夫框架内统一了自回归(AR)和扩散。DART使用与标准语言模型相同架构的AR模型,在空间和频谱上迭代地对图像块进行去噪。DART不依赖图像量化,从而在保持灵活性的同时实现更有效的图像建模。此外,DART在统一模型中无缝地使用文本和图像数据进行训练。我们的方法在类别条件和文本到图像生成任务上展示了具有竞争力的性能,为传统扩散模型提供了一种可扩展、高效的替代方案。通过这一统一框架,DART为可扩展、高质量的图像合成设立了新的基准。
引用
@article{arxiv.2410.08159,
title = {DART: Denoising Autoregressive Transformer for Scalable Text-to-Image Generation},
author = {Jiatao Gu and Yuyang Wang and Yizhe Zhang and Qihang Zhang and Dinghuai Zhang and Navdeep Jaitly and Josh Susskind and Shuangfei Zhai},
journal= {arXiv preprint arXiv:2410.08159},
year = {2025}
}
备注
Accepted by ICLR2025