高效视频扩散模型:进展与挑战
计算机视觉与模式识别
2026-04-20 v1
摘要
视频扩散模型已迅速成为高保真生成视频合成的主导范式,但其实际部署仍受限于严重的推理成本。与图像生成相比,视频合成在空间时间 token 增长和迭代去噪方面导致计算复杂度显著增加,使注意力和内存流量在实际场景中成为主要瓶颈。本综述提供了一系列表征高效视频扩散模型的系统性、面向部署的综述。我们提出了一种统一的分类,将现有方法组织为四类主要范式,包括步骤蒸馏、高效注意力、模型压缩和缓存/轨迹优化。基于此分类,我们分别分析了这四类方法的算法趋势,探讨了不同设计选择如何针对两个核心目标:减少函数评估次数和最小化每步开销。最后,我们讨论了开放挑战和未来方向,包括复合加速下的质量保持、硬件-软件协同设计、可靠的实时长程生成以及标准化评估的开放基础设施。据我们所知,本工作是高效视频扩散模型领域的首个全面综述,为研究者和工程师提供了该领域及其新兴研究方向的结构化概览。
引用
@article{arxiv.2604.15911,
title = {Efficient Video Diffusion Models: Advancements and Challenges},
author = {Shitong Shao and Lichen Bai and Pengfei Wan and James Kwok and Zeke Xie},
journal= {arXiv preprint arXiv:2604.15911},
year = {2026}
}