中文

DiSA:自回归图像生成中的扩散步长退火

计算机视觉与模式识别 2025-05-27 v1 计算与语言

摘要

越来越多的自回归模型(如 MAR、FlowAR、xAR 和 Harmon)采用扩散采样来提高图像生成质量。然而,这种策略导致推理效率低下,因为扩散采样一个 token 通常需要 50 到 100 步。本文探讨了如何有效解决这个问题。我们的核心动机是,随着自回归过程中生成更多的 token,后续的 token 遵循更受限的分布,并且更容易采样。直观地解释,如果模型已经生成了一只狗的一部分,剩余的 token 必须完成这只狗,因此受到更多限制。经验证据支持我们的动机:在生成的后期阶段,下一个 token 可以被多层感知器很好地预测,表现出低方差,并遵循从噪声到 token 的更接近直线的去噪路径。基于我们的发现,我们引入了扩散步长退火(DiSA),这是一种免训练方法,随着更多 token 的生成,逐渐使用更少的扩散步数,例如,在开始时使用 50 步,并在后期阶段逐渐减少到 5 步。因为 DiSA 源于我们针对自回归模型中扩散现象的特定发现,所以它是对仅为扩散设计的现有加速方法的补充。DiSA 只需在现有模型上用几行代码即可实现,尽管简单,但在保持生成质量的同时,为 MAR 和 Harmon 实现了 510×5-10\times 的推理加速,为 FlowAR 和 xAR 实现了 1.42.5×1.4-2.5\times 的加速。

关键词

引用

@article{arxiv.2505.20297,
  title  = {DiSA: Diffusion Step Annealing in Autoregressive Image Generation},
  author = {Qinyu Zhao and Jaskirat Singh and Ming Xu and Akshay Asthana and Stephen Gould and Liang Zheng},
  journal= {arXiv preprint arXiv:2505.20297},
  year   = {2025}
}

备注

Our code is available at https://github.com/Qinyu-Allen-Zhao/DiSA