MoGA:用于 end-to-end 长视频生成的混合-组注意力
计算机视觉与模式识别
2025-10-22 v1
摘要
Diffusion Transformers (DiTs) 的长视频生成受限于序列长度上全注意力的二次比例缩放。由于注意力高度冗余,输出主要由小 subset query-key 对主导。现有的稀疏方法依赖块式粗糙估计,其准确性-效率权衡受限于块大小。本文引入混合-组注意力 (MoGA),一种高效稀疏注意力方法,使用轻量级可学习 token router 实现精确标记匹配,无需块式估计。通过语义感知路由,MoGA 启用了有效的长程相互作用。作为无 kernel 的方法,MoGA 可无缝集成到现代注意力堆栈中,包括 FlashAttention 和序列并行。基于 MoGA,我们开发了一种高效的长视频生成模型,能够 end-to-end 生成约 580k 上下文长度的分钟级、多镜头、480p 视频,帧率为 24 fps。各种视频生成任务的全面实验验证了我们方法的有效性。
引用
@article{arxiv.2510.18692,
title = {MoGA: Mixture-of-Groups Attention for End-to-End Long Video Generation},
author = {Weinan Jia and Yuning Lu and Mengqi Huang and Hualiang Wang and Binyuan Huang and Nan Chen and Mu Liu and Jidong Jiang and Zhendong Mao},
journal= {arXiv preprint arXiv:2510.18692},
year = {2025}
}
备注
15 pages, 12 figures