中文

Mobius:面向文本到视频生成任务的高效时空并行训练范式

计算机视觉与模式识别 2024-07-24 v4

摘要

受文本到图像(T2I)生成任务成功的启发,许多研究者致力于文本到视频(T2V)生成任务。大多数 T2V 框架继承 T2I 模型并添加额外的时序层以生成动态视频,可视为微调任务。然而,传统 3D-Unet 采用串行模式,时序层随后跟随空间层,导致其串行特征流引发高 GPU 内存和训练时间消耗。我们认为,随着大型扩散模型和大规模数据集的发展,此类串行模式将带来更高的训练成本,不够环保,也不利于 T2V 的发展。因此,我们提出了一种用于 T2V 任务的高效时空并行训练范式,命名为 Mobius。在 3D-Unet 中,时序层和空间层并行,从而优化特征流和反向传播。Mobius 可节省 24% 的 GPU 内存和 12% 的训练时间,显著提升了 T2V 微调任务,并为 AIGC 社区提供了新的视角。我们将在未来发布代码。

关键词

引用

@article{arxiv.2407.06617,
  title  = {Mobius: A High Efficient Spatial-Temporal Parallel Training Paradigm for Text-to-Video Generation Task},
  author = {Yiran Yang and Jinchao Zhang and Ying Deng and Jie Zhou},
  journal= {arXiv preprint arXiv:2407.06617},
  year   = {2024}
}