中文

通过对角解码实现快速自回归视频生成

计算机视觉与模式识别 2025-03-19 v1 人工智能

摘要

自回归 Transformer 模型在视频生成中展现了惊人的性能,但其逐标记的逐步解码过程在处理由数万标记表示的长视频时构成了主要瓶颈。本文提出了对角解码 (Diagonal Decoding, DiagD),这是一种针对已训练的自回归模型的训练-free 推理加速算法,利用视频中的空间和时间相关性。我们的方法沿着空间-时间标记网格中的对角线路径生成标记,使每个帧内的并行解码成为可能,同时在连续帧之间实现部分重叠。该方法具有通用性和适应性,可适用于各种生成模型和任务,同时提供灵活的推理速度与视觉质量之间的权衡。此外,我们提出了一种成本效益高的微调策略,将模型的注意力模式与我们的解码顺序对齐,从而在小规模模型上进一步缩小训练-推理差距。在多个自回归视频生成模型和数据集上的实验表明,DiagD 相较于朴素的顺序解码可实现最高达 10×10\times 的加速,同时保持可comparable的视觉保真度。

关键词

引用

@article{arxiv.2503.14070,
  title  = {Fast Autoregressive Video Generation with Diagonal Decoding},
  author = {Yang Ye and Junliang Guo and Haoyu Wu and Tianyu He and Tim Pearce and Tabish Rashid and Katja Hofmann and Jiang Bian},
  journal= {arXiv preprint arXiv:2503.14070},
  year   = {2025}
}