Sparse-vDiT:释放稀疏注意力以加速视频扩散 Transformer
计算机视觉与模式识别
2025-06-04 v1 人工智能
机器学习
摘要
尽管扩散 Transformer(DiT)在视频生成方面取得了突破,但这种长序列生成任务仍受限于注意力机制的二次复杂度,导致显著的推理延迟。通过对视频扩散 Transformer(vDiT)中注意力图的详细分析,我们识别出三种反复出现的稀疏模式:对角线、多对角线和竖条结构。并且甚至 3-6% 的注意力头可以被跳过。关键的是,这些模式表现出强烈的层深度和头位置相关性,但对输入内容的依赖性有限。利用这些发现,我们提出了 Sparse-vDiT,一个用于 vDiT 的稀疏加速框架,包含:1)模式优化的稀疏核,用计算高效的实现来替换每种识别出的稀疏模式的密集注意力。2)离线稀疏扩散搜索算法,通过硬件感知成本建模为每层和每个头选择最优稀疏计算策略。在确定最优配置后,我们融合同一层中共享相同注意力策略的头,以提高推理效率。集成到最先进的 vDiT 模型(CogVideoX1.5、HunyuanVideo 和 Wan2.1)中,Sparse-vDiT 分别实现了 2.09、2.38 和 1.67 的理论 FLOP 减少,以及 1.76、1.85 和 1.58 的实际推理加速,同时保持了高视觉保真度,PSNR 值分别达到 24.13、27.09 和 22.59。我们的工作表明,vDiT 中的潜在结构稀疏性可以被系统性地利用于长视频合成。
引用
@article{arxiv.2506.03065,
title = {Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers},
author = {Pengtao Chen and Xianfang Zeng and Maosen Zhao and Peng Ye and Mingzhu Shen and Wei Cheng and Gang Yu and Tao Chen},
journal= {arXiv preprint arXiv:2506.03065},
year = {2025}
}