中文

用于生成式建模的因果扩散 Transformer

计算机视觉与模式识别 2024-12-18 v2

摘要

我们引入了因果扩散(Causal Diffusion)作为扩散模型的自回归(AR)对应物。它是一个下一个 token 预测框架,对离散和连续模态均友好,并且与现有的如下一个 token 预测模型(如 LLaMA 和 GPT)兼容。虽然最近的工作试图将扩散与 AR 模型相结合,但我们表明,将序列分解引入扩散模型可以大幅提升其性能,并实现 AR 与扩散生成模式之间的平滑过渡。因此,我们提出了 CausalFusion——一个仅解码器的 Transformer,它跨序列 token 和扩散噪声水平对数据进行双重分解,在 ImageNet 生成基准测试上取得了 SOTA 结果,同时享有 AR 模型为上下文推理生成任意数量 token 的优势。我们进一步通过一个联合图像生成与描述模型展示了 CausalFusion 的多模态能力,并展示了 CausalFusion 进行零样本上下文图像处理的能力。我们希望这项工作能为社区在离散和连续数据上训练多模态模型提供全新的视角。

关键词

引用

@article{arxiv.2412.12095,
  title  = {Causal Diffusion Transformers for Generative Modeling},
  author = {Chaorui Deng and Deyao Zhu and Kunchang Li and Shi Guang and Haoqi Fan},
  journal= {arXiv preprint arXiv:2412.12095},
  year   = {2024}
}

备注

22 figures, 21 pages