GLOBER:基于全局引导视频解码器的连贯非自回归视频生成
计算机视觉与模式识别
2023-09-26 v1
摘要
视频生成需要全局连贯性与局部真实感。本工作提出一种新型非自回归方法 GLOBER,其首先生成全局特征以获得全面全局引导,随后基于全局特征合成视频帧以生成连贯视频。具体而言,我们提出一个视频自编码器,其中视频编码器将视频编码为全局特征,而构建于扩散模型之上的视频解码器以非自回归方式解码全局特征并合成视频帧。为获得最大灵活性,我们的视频解码器通过归一化帧索引感知时序信息,使其能合成具有预定起始与结束帧索引的任意子视频片段。此外,引入一种新型对抗损失以提升合成视频帧间的全局连贯性与局部真实感。最后,我们采用基于扩散的视频生成器来拟合视频编码器输出的全局特征以进行视频生成。大量实验结果证明了我们所提方法的有效性与高效性,并在多个基准上取得了新的 SOTA 结果。
引用
@article{arxiv.2309.13274,
title = {GLOBER: Coherent Non-autoregressive Video Generation via GLOBal Guided Video DecodER},
author = {Mingzhen Sun and Weining Wang and Zihan Qin and Jiahui Sun and Sihan Chen and Jing Liu},
journal= {arXiv preprint arXiv:2309.13274},
year = {2023}
}