中文

基于幅值感知缓存的 MagCache:快速视频生成

计算机视觉与模式识别 2025-11-06 v2

摘要

现有的视频扩散模型加速技术通常依赖统一的经验法则或时序嵌入变体,以跳过时间步并复用缓存特征。这些方法通常需要针对精心挑选的提示词进行大量校准,并因提示词特定的过拟合而风险输出不一致。本文我们引入一种新颖且稳健的发现:在不同模型和提示词之间观察到的统一幅值规律。具体而言,连续残差输出的幅值比值在大多数时间步中呈单调递减,前几个时间步稳定下降,后几个时间步快速下降。基于此洞见,我们引入基于幅值感知的缓存(MagCache),以误差建模机制和自适应缓存策略自适应跳过不重要的时间步。不同于需要数十个精心挑选样本进行校准的现有方法,MagCache 只需一个样本即可完成校准。实验结果表明,MagCache 在 Open-Sora、CogVideoX、 Wan 2.1 和 HunyuanVideo 上实现 2.10 倍至 2.68 倍的加速,同时保持卓越的视觉保真度。在类似计算预算下,MagCache 在 LPIPS、SSIM 和 PSNR 等指标上显著优于现有方法。

关键词

引用

@article{arxiv.2506.09045,
  title  = {MagCache: Fast Video Generation with Magnitude-Aware Cache},
  author = {Zehong Ma and Longhui Wei and Feng Wang and Shiliang Zhang and Qi Tian},
  journal= {arXiv preprint arXiv:2506.09045},
  year   = {2025}
}

备注

Project Page: https://zehong-ma.github.io/MagCache Accepted by NeurIPS 2025