中文

RAVEN:利用高效三平面网络重新思考对抗视频生成

计算机视觉与模式识别 2024-08-13 v2 机器学习

摘要

我们提出了一种新颖的无条件视频生成模型,旨在解决长期时空依赖关系,同时关注计算和数据集效率。为了捕捉长时空依赖关系,我们的方法融合了一种受三维物体表示的三维感知生成框架启发的混合显式-隐式三平面表示,并采用单个潜在编码来建模整个视频片段。然后,从中间三平面表示合成单个视频帧,该中间表示本身源自主潜在编码。与最高效的最先进方法相比,这种新颖策略将计算复杂度(以FLOPs衡量)降低了一半以上。因此,我们的方法促进了视频的高效且时间连贯的生成。此外,与自回归方法相比,我们的联合帧建模方法减轻了视觉伪影的生成。我们通过在基于生成对抗网络(GAN)的生成器架构中集成一个基于光流的模块,进一步增强了模型的能力,从而补偿了较小生成器尺寸所带来的限制。结果,我们的模型能够合成分辨率为256×256256\times256像素、时长超过55秒、帧率为30 fps的高保真视频片段。我们方法的有效性和多功能性通过在包含合成和真实视频片段的三个不同数据集上的定性和定量评估得到了实证验证。我们将公开我们的训练和推理代码。

关键词

引用

@article{arxiv.2401.06035,
  title  = {RAVEN: Rethinking Adversarial Video Generation with Efficient Tri-plane Networks},
  author = {Partha Ghosh and Soubhik Sanyal and Cordelia Schmid and Bernhard Schölkopf},
  journal= {arXiv preprint arXiv:2401.06035},
  year   = {2024}
}