中文

高效视频扩散模型:进展与挑战

计算机视觉与模式识别 2026-04-20 v1

摘要

视频扩散模型已迅速成为高保真生成视频合成的主导范式,但其实际部署仍受限于严重的推理成本。与图像生成相比,视频合成在空间时间 token 增长和迭代去噪方面导致计算复杂度显著增加,使注意力和内存流量在实际场景中成为主要瓶颈。本综述提供了一系列表征高效视频扩散模型的系统性、面向部署的综述。我们提出了一种统一的分类,将现有方法组织为四类主要范式,包括步骤蒸馏、高效注意力、模型压缩和缓存/轨迹优化。基于此分类,我们分别分析了这四类方法的算法趋势,探讨了不同设计选择如何针对两个核心目标:减少函数评估次数和最小化每步开销。最后,我们讨论了开放挑战和未来方向,包括复合加速下的质量保持、硬件-软件协同设计、可靠的实时长程生成以及标准化评估的开放基础设施。据我们所知,本工作是高效视频扩散模型领域的首个全面综述,为研究者和工程师提供了该领域及其新兴研究方向的结构化概览。

关键词

引用

@article{arxiv.2604.15911,
  title  = {Efficient Video Diffusion Models: Advancements and Challenges},
  author = {Shitong Shao and Lichen Bai and Pengfei Wan and James Kwok and Zeke Xie},
  journal= {arXiv preprint arXiv:2604.15911},
  year   = {2026}
}