中文

驯服教师强制:掩码自回归视频生成框架

计算机视觉与模式识别 2025-01-22 v1

摘要

我们引入了MAGI,一种混合视频生成框架,将掩码建模用于帧内生成,同时使用因果建模用于下一帧生成。我们的关键创新是 Complete Teacher Forcing(CTF),它将掩码帧条件化于完整观察帧上(即 Masked Teacher Forcing, MTF),实现从 token 级别(patch 级别)到帧级别自回归生成的平滑过渡。CTF 在 FVD 分数上显著优于 MTF,提升幅度达23%。为解决暴露偏差等问题,我们采用针对性训练策略,为自回归视频生成树立了新基准。实验表明,MAGI 能够生成超过100帧的长篇连贯视频,即便仅使用16帧进行训练,更凸显其在可扩展高质量视频生成方面的潜力。

关键词

引用

@article{arxiv.2501.12389,
  title  = {Taming Teacher Forcing for Masked Autoregressive Video Generation},
  author = {Deyu Zhou and Quan Sun and Yuang Peng and Kun Yan and Runpei Dong and Duomin Wang and Zheng Ge and Nan Duan and Xiangyu Zhang and Lionel M. Ni and Heung-Yeung Shum},
  journal= {arXiv preprint arXiv:2501.12389},
  year   = {2025}
}

备注

12 pages, 9 figures