中文

径向注意力:面向长视频生成的 O(n log n) 稀疏注意力机制及其能量衰减

计算机视觉与模式识别 2025-12-09 v2 人工智能 机器学习

摘要

近期扩散模型的进展使得高质量视频生成成为可能,但额外的时序维度显著增加了计算成本,使得在长视频上进行训练和推理变得代价高昂。本文我们发现并提出一种称为时空能量衰减的现象:在视频扩散模型中,软最大化后的注意力得分随着 token 之间在空间和时间上的距离增加而衰减,这类似于自然界中信号或波随空间和时间衰减的现象。在此基础上,我们提出了径向注意力(Radial Attention),一种具有 O(nlogn)\mathcal{O}(n \log n) 复杂度的可扩展稀疏注意力机制,将能量衰减转化为指数衰减的计算密度,相较于标准 O(n2)\mathcal{O}(n^2) 的稠密注意力更为高效,同时也比线性注意力更具表达性。具体而言,径向注意力采用简单的、静态注意力掩码,使得每个 token 只关注空间上相邻的 token,且注意力窗口大小随时间距离而减小。此外,它允许通过高效的 LoRA-based 微调方式,将预训练的视频扩散模型扩展到更长的生成长度。大量实验表明,径向注意力在 Wan2.1-14B、HunyuanVideo 和 Mochi 1 三大模型上均能维持视频质量,相较于原始稠密注意力最高可实现 1.9 倍加速。经 minimal 微调后,可实现生成长度最长提升至原来的 4 倍,训练成本最高可降低 4.4 倍,推理加速最高可达 3.7 倍。代码已发布于 \href{https://github.com/mit-han-lab/radial-attention}{https://github.com/mit-han-lab/radial-attention}。

关键词

引用

@article{arxiv.2506.19852,
  title  = {Radial Attention: $O(n\log n)$ Sparse Attention with Energy Decay for Long Video Generation},
  author = {Xingyang Li and Muyang Li and Tianle Cai and Haocheng Xi and Shuo Yang and Yujun Lin and Lvmin Zhang and Songlin Yang and Jinbo Hu and Kelly Peng and Maneesh Agrawala and Ion Stoica and Kurt Keutzer and Song Han},
  journal= {arXiv preprint arXiv:2506.19852},
  year   = {2025}
}

备注

Accepted to NeurIPS 2025, Code: https://github.com/mit-han-lab/radial-attention