SALAD:基于高效线性注意力调优实现稀疏注意力的视频扩散Transformer
计算机视觉与模式识别
2026-04-03 v2
摘要
扩散Transformer在视频生成中展现了卓越的性能。然而,其长序列输入由于全注意力的二次复杂度,导致延迟显著。已提出 various 稀疏注意力机制。训练-free 方法仅能实现中等稀疏度,因而仅获得有限的加速;而训练-based 方法可达更高稀疏度,但需要大量数据和计算资源。本文提出 SALAD,在稀疏注意力分支并行引入轻量级线性注意力分支。通过多级静态-动态比例缩放策略平衡两个分支,我们实现了最高达90%的稀疏度和跨不同模型和序列长度的 1.52-2.03 倍推理加速,同时保持与全注意力基线相当的生成质量。此外,我们的微调过程高效,仅需 2000 个视频样本,少于 1600 次训练步数,batch size 为 8 时 GPU 时间不超过 30 小时。
关键词
引用
@article{arxiv.2601.16515,
title = {SALAD: Achieve High-Sparsity Attention via Efficient Linear Attention Tuning for Video Diffusion Transformer},
author = {Tongcheng Fang and Hanling Zhang and Ruiqi Xie and Zhuo Han and Xin Tao and Tianchen Zhao and Pengfei Wan and Wenbo Ding and Wanli Ouyang and Xuefei Ning and Yu Wang},
journal= {arXiv preprint arXiv:2601.16515},
year = {2026}
}