EasyAnimate: 具有混合窗口注意力和奖励反向传播的高性能视频生成框架
计算机视觉与模式识别
2026-03-06 v3 计算与语言
多媒体
摘要
本文介绍了EasyAnimate,一个高效且高质量的视频生成框架,利用扩散变换器实现高质量视频制作,涵盖数据处理、模型训练和端到端推理。尽管视频扩散模型取得了显著进展,但现有的视频生成模型仍然存在生成速度慢和视频质量不理想的问题。为了在不牺牲性能的情况下提高训练和推理效率,我们提出了混合窗口注意力。我们在混合窗口注意力中设计了多方向滑动窗口注意力,与朴素版本相比,它在三维维度上提供了更强的感受能力,同时随着视频序列长度的增加降低了模型的计算复杂度。为了提升视频生成质量,我们使用奖励反向传播优化EasyAnimate,以更好地与人类偏好对齐。作为一种后训练方法,它在确保效率的同时大大增强了模型性能。除了上述改进,EasyAnimate还集成了一系列进一步优化,显著提高了计算效率和模型性能。我们引入了一种新的训练策略,称为Token长度训练,以解决不同分辨率和长度训练视频中GPU利用率不均的问题,从而提高效率。此外,我们使用多模态大语言模型作为文本编码器,以改善模型的文本理解能力。实验表明,上述改进带来了显著的性能提升。EasyAnimate在VBench排行榜和人工评估中均达到了最先进的性能。代码和预训练模型可在https://github.com/aigc-apps/EasyAnimate获取。
引用
@article{arxiv.2405.18991,
title = {EasyAnimate: High-Performance Video Generation Framework with Hybrid Windows Attention and Reward Backpropagation},
author = {Jiaqi Xu and Kunzhe Huang and Xinyi Zou and Yunkuo Chen and Bo Liu and MengLi Cheng and Jun Huang and Xing Shi},
journal= {arXiv preprint arXiv:2405.18991},
year = {2026}
}
备注
10 pages, 8 figures, ACM MM 2025