中文

D-AR:基于自回归模型的扩散

计算机视觉与模式识别 2025-05-30 v1

摘要

本文提出了基于自回归模型的扩散(Diffusion via Autoregressive models, D-AR),这是一种将图像扩散过程重新转化为标准下一词元预测(next-token-prediction)方式下普通自回归过程的新范式。我们首先设计了分词器,将图像转换为离散词元序列,其中不同位置的词元可解码为像素空间中不同的扩散去噪步骤。得益于扩散特性,这些词元自然遵循从粗到细的顺序,这直接适用于自回归建模。因此,我们在这些词元上应用标准的下一词元预测,而无需修改任何底层设计(无论是因果掩码还是训练/推理策略),并且这种顺序自回归词元生成直接映射了图像空间中的扩散过程。也就是说,一旦自回归模型生成一批增量词元,我们就可以直接以流式方式将这些词元解码为相应的扩散去噪步骤。我们的流程自然展现出若干有趣的特性,例如,它支持仅生成词元子集时的一致性预览,并支持零样本布局控制合成。在标准 ImageNet 基准上,我们的方法在使用 775M Llama 主干网络和 256 个离散词元的情况下实现了 2.09 的 FID。我们希望这项工作能启发未来关于视觉合成统一自回归架构的研究,尤其是结合大语言模型的研究。代码和模型将发布于 https://github.com/showlab/D-AR

关键词

引用

@article{arxiv.2505.23660,
  title  = {D-AR: Diffusion via Autoregressive Models},
  author = {Ziteng Gao and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2505.23660},
  year   = {2025}
}

备注

Technical report