中文

利用精简推理实现快速且内存高效的视频扩散

计算机视觉与模式识别 2024-11-05 v1 人工智能

摘要

人工智能生成内容(AIGC)的快速发展,尤其是扩散模型,显著推动了高质量视频生成的发展。然而,当前视频扩散模型展现出苛刻的计算需求和高峰值内存占用,尤其是在生成更长和更高分辨率的视频时。这些限制严重阻碍了视频扩散模型在标准硬件平台上的实际应用。为解决此问题,我们提出了一种新颖的无训练框架——Streamlined Inference,利用视频扩散模型的时间和空间特性。我们的方法整合三个核心组件:特征切片(Feature Slicer)、算子分组(Operator Grouping)和步骤重哈希(Step Rehash)。具体而言,特征切片有效地将输入特征划分为子特征,算子分组使用一组连续算子处理每个子特征,在不牺牲质量和速度的前提下实现显著的内存缩减。步骤重哈希进一步利用扩散过程中相邻步骤之间的相似性,通过跳过不必要的步骤加速推理。大量实验表明,我们的方法显著降低了峰值内存和计算开销,使得在单个消费级GPU上生成高质量视频成为可能(例如,将AnimateDiff的峰值内存从42GB降至11GB,在2080Ti上实现更快推理)。

关键词

引用

@article{arxiv.2411.01171,
  title  = {Fast and Memory-Efficient Video Diffusion Using Streamlined Inference},
  author = {Zheng Zhan and Yushu Wu and Yifan Gong and Zichong Meng and Zhenglun Kong and Changdi Yang and Geng Yuan and Pu Zhao and Wei Niu and Yanzhi Wang},
  journal= {arXiv preprint arXiv:2411.01171},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024