视频压缩遇上视频生成:基于注意力恢复的潜在时序帧剪枝
计算机视觉与模式识别
2026-04-30 v2
摘要
当前视频生成模型因计算延迟高,导致实时应用成本 prohibitively高。本文通过利用视频潜在 patch 之间的时序冗余性来解决这一限制。为此,我们提出了潜在时序帧剪枝与注意力恢复(LIPAR)框架,该框架检测并跳过重复潜在 patch 的重新计算。此外,我们引入了一种新颖的注意力恢复机制,以近似方法计算被剪枝 token 的注意力值,从而消除对粗糙应用剪枝方法时产生的视觉伪影。经实验验证,我们的方法将视频编辑吞吐量提高 ,在 NVIDIA RTX 4090 上使用 1.3B Self-Forcing 模型(4 步去噪,FP16)实现平均 19.3 FPS。该方法不影响生成质量,可无缝集成到模型中无需额外训练。我们的方法有效地桥接了传统压缩算法与现代生成管线之间的差距。
引用
@article{arxiv.2603.05811,
title = {Video Compression Meets Video Generation: Latent Inter-Frame Pruning with Attention Recovery},
author = {Dennis Menn and Yuedong Yang and Bokun Wang and Xiwen Wei and Mustafa Munir and Feng Liang and Radu Marculescu and Chenfeng Xu and Diana Marculescu},
journal= {arXiv preprint arXiv:2603.05811},
year = {2026}
}