中文

面向景观动画的细粒度运动嵌入学习

计算机视觉与模式识别 2021-09-14 v2

摘要

本文关注景观动画,其目标是从单张景观图像生成延时视频。运动对景观动画至关重要,因为它决定了视频中物体的运动方式。现有方法能够通过从真实延时视频中学习运动来生成吸引人的视频。然而,当前方法存在运动生成不准确的问题,导致不真实的视频结果。为解决这个问题,我们提出一个名为 FGLA 的模型,通过面向景观动画学习细粒度运动嵌入(Fine-Grained motion embedding for Landscape Animation)来生成高质量且真实的视频。我们的模型由两部分组成:(1) 以细粒度方式嵌入延时运动的运动编码器;(2) 生成真实运动以使输入图像动起来的运动生成器。为了在多样的延时视频上训练和评估,我们构建了最大的高分辨率多场景延时视频数据集,即 Time-lapse-D,其包含 16,874 个视频片段,超过 1000 万帧。定量与定性实验结果证明了我们方法的优越性。特别地,在我们的数据集上,与最先进(SOTA)方法相比,我们的方法在 LIPIS 上取得 19% 的相对提升,在 FVD 上取得 5.6% 的相对提升。一项由 700 名受试者参与的用户研究表明,我们的方法在视觉上大幅优于现有方法。

关键词

引用

@article{arxiv.2109.02216,
  title  = {Learning Fine-Grained Motion Embedding for Landscape Animation},
  author = {Hongwei Xue and Bei Liu and Huan Yang and Jianlong Fu and Houqiang Li and Jiebo Luo},
  journal= {arXiv preprint arXiv:2109.02216},
  year   = {2021}
}

备注

Accepted by ACM Multimedia 2021 as an oral paper