中文

MoGA:用于 end-to-end 长视频生成的混合-组注意力

计算机视觉与模式识别 2025-10-22 v1

摘要

Diffusion Transformers (DiTs) 的长视频生成受限于序列长度上全注意力的二次比例缩放。由于注意力高度冗余,输出主要由小 subset query-key 对主导。现有的稀疏方法依赖块式粗糙估计,其准确性-效率权衡受限于块大小。本文引入混合-组注意力 (MoGA),一种高效稀疏注意力方法,使用轻量级可学习 token router 实现精确标记匹配,无需块式估计。通过语义感知路由,MoGA 启用了有效的长程相互作用。作为无 kernel 的方法,MoGA 可无缝集成到现代注意力堆栈中,包括 FlashAttention 和序列并行。基于 MoGA,我们开发了一种高效的长视频生成模型,能够 end-to-end 生成约 580k 上下文长度的分钟级、多镜头、480p 视频,帧率为 24 fps。各种视频生成任务的全面实验验证了我们方法的有效性。

关键词

引用

@article{arxiv.2510.18692,
  title  = {MoGA: Mixture-of-Groups Attention for End-to-End Long Video Generation},
  author = {Weinan Jia and Yuning Lu and Mengqi Huang and Hualiang Wang and Binyuan Huang and Nan Chen and Mu Liu and Jidong Jiang and Zhendong Mao},
  journal= {arXiv preprint arXiv:2510.18692},
  year   = {2025}
}

备注

15 pages, 12 figures