中文

尺度化 VAR 实为离散扩散

计算机视觉与模式识别 2025-09-29 v1 机器学习

摘要

自回归(AR)Transformer 已成为视觉生成的强大范式,这主要得益于其可扩展性、计算效率以及语言与视觉的统一架构。其中,下一尺度预测的视觉自回归生成(VAR)最近展现出了卓越的性能,甚至超越了基于扩散的模型。在这项工作中,我们重新审视 VAR 并揭示了一个理论见解:当配备马尔可夫注意力掩码时,VAR 在数学上等价于离散扩散。我们将这种重新解释称为基于离散扩散的可扩展视觉优化(SRDD),在 AR Transformer 和扩散模型之间建立了一座有原则的桥梁。利用这一新视角,我们展示了如何将扩散的优势(如迭代细化)直接引入 VAR 并减少架构低效性,从而实现更快的收敛、更低的推理成本以及改进的零样本重建。在多个数据集上,我们展示了基于扩散视角的 VAR 在效率和生成质量上带来了一致的提升。

关键词

引用

@article{arxiv.2509.22636,
  title  = {Scale-Wise VAR is Secretly Discrete Diffusion},
  author = {Amandeep Kumar and Nithin Gopalakrishnan Nair and Vishal M. Patel},
  journal= {arXiv preprint arXiv:2509.22636},
  year   = {2025}
}

备注

Technical Reports