中文

并行自回归视觉生成

计算机视觉与模式识别 2025-04-04 v3

摘要

自回归模型已成为视觉生成的强大方法,但因逐 token 预测的顺序过程,推理速度较慢。本文提出一种简单且有效的并行自回归视觉生成方法,在保持自回归建模优势的同时提升生成效率。我们的关键洞察是:并行生成取决于视觉 token 间的依赖关系——依赖弱的 token 可并行生成,而强依赖的相邻 token 难以同时生成,因为独立抽样可能导致不一致。基于此,我们开发了并行生成策略:对弱依赖的远距离 token 并行生成,同时保持强依赖的局部 token 的顺序生成。该方法可无缝集成到标准自回归模型中,无需修改架构或分词器。在 ImageNet 和 UCF-101 上的实验表明,我们的方法在可比质量下实现 3.6 倍加速,并在两者之间实现最高 9.5 倍加速,质量 degradation 最小。我们希望本工作能激发高效视觉生成和统一自回归建模的后续研究。项目页面:https://yuqingwang1029.github.io/PAR-project

关键词

引用

@article{arxiv.2412.15119,
  title  = {Parallelized Autoregressive Visual Generation},
  author = {Yuqing Wang and Shuhuai Ren and Zhijie Lin and Yujin Han and Haoyuan Guo and Zhenheng Yang and Difan Zou and Jiashi Feng and Xihui Liu},
  journal= {arXiv preprint arXiv:2412.15119},
  year   = {2025}
}

备注

CVPR 2025 Accepted - Project Page: https://yuqingwang1029.github.io/PAR-project