中文

面向视频扩散模型的块混合注意力(VMoBA)

计算机视觉与模式识别 2025-07-01 v1

摘要

全注意力机制的二次复杂度对于寻求生成长时段高分辨率视频的视频扩散模型(VDMs)构成了显著瓶颈。虽然已提出多种稀疏注意力方法,但许多方法设计为训练自由的推理加速器,或在原生训练时未能最佳捕捉视频数据固有的独特时空特征。本文引入视频块混合注意力(VMoBA)一种专为VDMs设计的新型稀疏注意力机制。深入分析预训练视频变换器中的注意力模式后,我们发现注意力呈现强烈的时空局部性、查询重要性差异以及特定注意力头的集中程度。VMoBA在原有MoBA框架基础上进行三项关键改进:(1)引入基于图层的循环块分区方案(1D-2D-3D),以适应多样化的时空注意力模式并提升效率;(2)全局块选择以优先处理整个注意力头中最显著的查询-键块相互作用;(3)基于阈值的块选择,以动态确定关注块的数量基于其累计相似度。广泛的实验表明,VMoBA显著加速了VDMs在更长序列上的训练,实现了2.92倍的FLOPs和1.48倍的延迟加速,同时保持与全注意力相当乃至更好的生成质量。此外,VMoBA在训练自由推理中也表现出竞争力,为高分辨率视频生成提供了2.40倍FLOPs和1.35倍延迟加速。

关键词

引用

@article{arxiv.2506.23858,
  title  = {VMoBA: Mixture-of-Block Attention for Video Diffusion Models},
  author = {Jianzong Wu and Liang Hou and Haotian Yang and Xin Tao and Ye Tian and Pengfei Wan and Di Zhang and Yunhai Tong},
  journal= {arXiv preprint arXiv:2506.23858},
  year   = {2025}
}

备注

Code is at https://github.com/KwaiVGI/VMoBA