中文

视频压缩遇上视频生成:基于注意力恢复的潜在时序帧剪枝

计算机视觉与模式识别 2026-04-30 v2

摘要

当前视频生成模型因计算延迟高,导致实时应用成本 prohibitively高。本文通过利用视频潜在 patch 之间的时序冗余性来解决这一限制。为此,我们提出了潜在时序帧剪枝与注意力恢复(LIPAR)框架,该框架检测并跳过重复潜在 patch 的重新计算。此外,我们引入了一种新颖的注意力恢复机制,以近似方法计算被剪枝 token 的注意力值,从而消除对粗糙应用剪枝方法时产生的视觉伪影。经实验验证,我们的方法将视频编辑吞吐量提高 1.53×1.53\times,在 NVIDIA RTX 4090 上使用 1.3B Self-Forcing 模型(4 步去噪,FP16)实现平均 19.3 FPS。该方法不影响生成质量,可无缝集成到模型中无需额外训练。我们的方法有效地桥接了传统压缩算法与现代生成管线之间的差距。

关键词

引用

@article{arxiv.2603.05811,
  title  = {Video Compression Meets Video Generation: Latent Inter-Frame Pruning with Attention Recovery},
  author = {Dennis Menn and Yuedong Yang and Bokun Wang and Xiwen Wei and Mustafa Munir and Feng Liang and Radu Marculescu and Chenfeng Xu and Diana Marculescu},
  journal= {arXiv preprint arXiv:2603.05811},
  year   = {2026}
}