中文

MaskFlow: 用于灵活高效长视频生成的离散流

计算机视觉与模式识别 2025-03-13 v2

摘要

生成高质量长视频仍是一项挑战,源于空间与时间动态的复杂交互以及硬件限制。在本工作中,我们引入MaskFlow,一个统一的视频生成框架,结合离散表示与流匹配,以实现高质量长视频的高效生成。通过在训练期间利用帧级掩码策略,MaskFlow以先前生成的无掩码帧为条件,生成长度超出训练序列十倍以上的视频。MaskFlow通过启用快速的Masked Generative Model(MGM)风格采样来实现高效性,并可部署于完全自回归以及全序列生成两种模式。我们在FaceForensics(FFS)和Deepmind Lab(DMLab)数据集上验证了方法质量,并报告了与最先进方法具有竞争力的Frechet Video Distance(FVD)。我们还提供了方法采样效率的详细分析,并证明MaskFlow可以以训练无关的方式应用于依赖时间步和不依赖时间步的模型。

关键词

引用

@article{arxiv.2502.11234,
  title  = {MaskFlow: Discrete Flows For Flexible and Efficient Long Video Generation},
  author = {Michael Fuest and Vincent Tao Hu and Björn Ommer},
  journal= {arXiv preprint arXiv:2502.11234},
  year   = {2025}
}

备注

Project page: https://compvis.github.io/maskflow/