中文

注意力稀疏性随输入稳定:基于离线稀疏性轮廓和在线 QK 共聚类的训练-free 视频生成稀疏注意力

计算机视觉与模式识别 2026-05-11 v2

摘要

扩散变换器 (DiT) 在视频生成中取得优异性能,但因稠密 3D 注意力导致推理成本高昂,激发稀疏注意力技术以提高效率。然而,现有的训练-free 视频生成稀疏注意力方法仍面临两个未解决的局限:忽视注意力剪枝中的层异质性,忽视块级划分中的查询-键耦合,妨碍了更好的质量-加速比。本文发现注意力稀疏性是内在的层级属性,不同输入间仅存在轻微差异。基于此洞察,我们提出 SVOO,一个通过离线层级稀疏性轮廓和在线 QK 共聚类实现的训练-free 稀疏注意力框架,用于快速视频生成。具体而言,SVOO 采用两阶段范式:(i) 离线层级灵敏度轮廓以导出每个层的固有剪枝水平,(ii) 在线通过双向共聚类算法实现块级稀疏注意力。对七个广泛使用的视频生成模型进行大量实验表明,SVOO 在质量-加速比上优于最先进的方法,在 Wan2.1 上实现最高 1.93 倍的加速,同时保持最高 29 dB 的 PSNR。代码已公开:https://github.com/Mutual-Luo/SVOO。

关键词

引用

@article{arxiv.2603.18636,
  title  = {Attention Sparsity is Input-Stable: Training-Free Sparse Attention for Video Generation via Offline Sparsity Profiling and Online QK Co-Clustering},
  author = {Jiayi Luo and Jiayu Chen and Jiankun Wang and Cong Wang and Hanxin Zhu and Qingyun Sun and Chen Gao and Zhibo Chen and Jianxin Li},
  journal= {arXiv preprint arXiv:2603.18636},
  year   = {2026}
}

备注

Accepted by ICML 2026