中文

FasterVAR:视觉自回归模型的即插即用加速框架

计算机视觉与模式识别 2026-05-28 v2

摘要

视觉自回归(VAR)建模通过下一尺度预测偏离了传统自回归(AR)模型的下一词元预测范式,从而实现高质量图像生成。然而,VAR 范式在大规模步骤中遭受急剧增加的计算复杂度和运行时间。虽然现有的加速方法减少了大规模步骤的运行时间,但依赖手动步骤选择并忽略了生成过程中不同阶段的重要性差异。为了应对这一挑战,我们提出了 FasterVAR,一个针对 VAR 模型的系统性研究和即插即用加速框架。我们的分析表明,早期步骤对于保持语义和结构一致性至关重要,应保持完整,而后期步骤主要细化细节,可以被剪枝或近似以加速。基于这些洞察,FasterVAR 引入了一种即插即用的加速策略,利用后期计算中的语义无关性和低秩特性,无需额外训练。我们提出的 FasterVAR 实现了高达 3.4 倍的速度提升,且几乎无性能损失,持续优于现有的加速基线。这些结果突显了面向阶段的设计作为高效视觉自回归图像生成的强大原则。

关键词

引用

@article{arxiv.2512.16483,
  title  = {FasterVAR: Plug-and-Play Acceleration for Visual Autoregressive Models},
  author = {Senmao Li and Kai Wang and Salman Khan and Fahad Shahbaz Khan and Jian Yang and Yaxing Wang},
  journal= {arXiv preprint arXiv:2512.16483},
  year   = {2026}
}

备注

Accepted at ICML2026