MAGVIT:掩码生成式视频Transformer
计算机视觉与模式识别
2023-04-06 v2
摘要
我们提出掩码生成式视频Transformer(MAsked Generative VIdeo Transformer, MAGVIT),以单一模型处理多种视频合成任务。我们引入3D分词器将视频量化为时空视觉词元,并提出一种用于掩码视频词元建模的嵌入方法以促进多任务学习。我们进行了广泛实验以展示MAGVIT的质量、效率与灵活性。实验表明:(i)MAGVIT优于当前最优方法,并在包括具挑战性的Kinetics-600在内的三个视频生成基准上确立了已发表的最佳FVD。(ii)MAGVIT在推理时间上比扩散模型快两个数量级,比自回归模型快60倍。(iii)单一MAGVIT模型支持十种多样生成任务,并可泛化至不同视觉领域的视频。源代码与训练模型将于https://magvit.cs.cmu.edu公开发布。
引用
@article{arxiv.2212.05199,
title = {MAGVIT: Masked Generative Video Transformer},
author = {Lijun Yu and Yong Cheng and Kihyuk Sohn and José Lezama and Han Zhang and Huiwen Chang and Alexander G. Hauptmann and Ming-Hsuan Yang and Yuan Hao and Irfan Essa and Lu Jiang},
journal= {arXiv preprint arXiv:2212.05199},
year = {2023}
}
备注
CVPR 2023 highlight