中文

VMonarch:基于结构注意力的高效视频扩散变换器

计算机视觉与模式识别 2026-02-02 v1 人工智能

摘要

注意力机制的二次复杂度严重限制了视频扩散变换器(DiTs)的上下文可扩展性。我们发现,视频DiTs中呈现的高度稀疏时空注意力模式可被自然地表示为Monarch矩阵。Monarch矩阵是一类具有灵活稀疏性的结构矩阵,能够通过交替最小化算法实现亚二次注意力。基于此,我们提出VMonarch,这是一种用于视频DiTs的新型注意力机制,能够高效地对动态稀疏模式进行结构Monarch矩阵的计算。首先,我们将时空Monarch分解适配,以显式捕获视频数据的帧内和帧间相关性。其次,我们引入一种重计算策略,以缓解在Monarch矩阵交替最小化过程中因数值不稳定性引发的伪影。最后,我们提出一种新型在线熵算法集成到FlashAttention中,实现对长序列的快速Monarch矩阵更新。大量实验表明,VMonarch在VBench上进行最小调参后,能够实现与全注意力相当或更好的生成质量。它克服了视频DiTs的注意力瓶颈,注意力FLOPs降低约17.5倍,在注意力计算上实现5倍以上的加速,在90%稀疏度下甚至超越当前最先进的稀疏注意力方法。

关键词

引用

@article{arxiv.2601.22275,
  title  = {VMonarch: Efficient Video Diffusion Transformers with Structured Attention},
  author = {Cheng Liang and Haoxian Chen and Liang Hou and Qi Fan and Gangshan Wu and Xin Tao and Limin Wang},
  journal= {arXiv preprint arXiv:2601.22275},
  year   = {2026}
}