中文

通过对角蒸馈实现流式自回归视频生成

计算机视觉与模式识别 2026-03-12 v2

摘要

大型预训练扩散模型显著提升了生成视频的质量,但其在实时流式场景中的应用仍有限。自回归模型提供了序列帧合成的自然框架,但为实现高保真度需要大量计算资源。扩散蒸馈可将这些模型压缩为高效的少步变体,但现有的视频蒸馈方法大多依赖图像专用方法,忽略了时序依赖性。这些技术在图像生成中表现优异,但在视频合成中表现不佳,表现出运动一致性降低、长序列中误差累积以及延迟与质量之间的权衡。我们识别出导致这些限制的两个因素:在步数减少期间未充分利用时序上下文,以及在下块预测中隐式预测后续噪声水平(即暴露偏差)。为解决这些问题,我们提出了对角蒸馈(Diagonal Distillation)方法,该方法在现有方法之上操作,更好地利用了跨视频块和去噪步骤的时序信息。我们方法的核心是非对称的生成策略:早期使用更多步骤,后期使用更少步骤。该设计使后续块能够继承经充分处理的早期块中丰富的外观信息,同时将部分去噪块作为后续合成的条件输入。通过将块生成期间隐式预测的后续噪声水平与实际推理条件对齐,我们的方法缓解了误差传播,减少了长程序列中的过饱和。我们进一步引入了隐式光流建模,在严格的步数限制下保持运动质量。该方法在2.61秒内生成5秒视频(最高达31 FPS),相较于未蒸馈模型实现了277.3倍的加速。

关键词

引用

@article{arxiv.2603.09488,
  title  = {Streaming Autoregressive Video Generation via Diagonal Distillation},
  author = {Jinxiu Liu and Xuanming Liu and Kangfu Mei and Yandong Wen and Ming-Hsuan Yang and Weiyang Liu},
  journal= {arXiv preprint arXiv:2603.09488},
  year   = {2026}
}

备注

ICLR 2026 (31 pages, 10 figures, project page: https://spherelab.ai/diagdistill/)