中文

通过下一帧扩散以 30+ FPS 运行 Transformer

计算机视觉与模式识别 2025-07-08 v2 人工智能

摘要

自回归视频模型在创建交互式视频内容和支持任意时长的流式应用方面,相比双向扩散模型具有独特优势。在本工作中,我们提出了下一帧扩散(Next-Frame Diffusion, NFD),这是一种自回归扩散 Transformer,结合了分块因果注意力,能够通过每帧内并行 token 生成实现迭代采样与高效推理。然而,由于扩散采样的高计算成本以及自回归生成固有的硬件低效性,实现实时视频生成仍然是此类模型面临的重大挑战。为了解决这一问题,我们引入了两项创新:(1)我们将一致性蒸馏扩展到视频领域,并专门针对视频模型进行了适配,从而实现仅需少量采样步骤的高效推理;(2)为了充分利用并行计算,受相邻帧通常共享相同动作输入这一观察的启发,我们提出了推测采样。在这种方法中,模型使用当前动作输入生成接下来的几帧,如果输入动作不同,则丢弃推测生成的帧。在大规模动作条件视频生成基准上的实验表明,NFD 在视觉质量和采样效率方面均优于自回归基线。我们首次在 A100 GPU 上使用 310M 模型实现了超过 30 FPS 的自回归视频生成。

关键词

引用

@article{arxiv.2506.01380,
  title  = {Playing with Transformer at 30+ FPS via Next-Frame Diffusion},
  author = {Xinle Cheng and Tianyu He and Jiayi Xu and Junliang Guo and Di He and Jiang Bian},
  journal= {arXiv preprint arXiv:2506.01380},
  year   = {2025}
}

备注

Project page: https://nextframed.github.io/