面向景观动画的细粒度运动嵌入学习
计算机视觉与模式识别
2021-09-14 v2
摘要
本文关注景观动画,其目标是从单张景观图像生成延时视频。运动对景观动画至关重要,因为它决定了视频中物体的运动方式。现有方法能够通过从真实延时视频中学习运动来生成吸引人的视频。然而,当前方法存在运动生成不准确的问题,导致不真实的视频结果。为解决这个问题,我们提出一个名为 FGLA 的模型,通过面向景观动画学习细粒度运动嵌入(Fine-Grained motion embedding for Landscape Animation)来生成高质量且真实的视频。我们的模型由两部分组成:(1) 以细粒度方式嵌入延时运动的运动编码器;(2) 生成真实运动以使输入图像动起来的运动生成器。为了在多样的延时视频上训练和评估,我们构建了最大的高分辨率多场景延时视频数据集,即 Time-lapse-D,其包含 16,874 个视频片段,超过 1000 万帧。定量与定性实验结果证明了我们方法的优越性。特别地,在我们的数据集上,与最先进(SOTA)方法相比,我们的方法在 LIPIS 上取得 19% 的相对提升,在 FVD 上取得 5.6% 的相对提升。一项由 700 名受试者参与的用户研究表明,我们的方法在视觉上大幅优于现有方法。
引用
@article{arxiv.2109.02216,
title = {Learning Fine-Grained Motion Embedding for Landscape Animation},
author = {Hongwei Xue and Bei Liu and Huan Yang and Jianlong Fu and Houqiang Li and Jiebo Luo},
journal= {arXiv preprint arXiv:2109.02216},
year = {2021}
}
备注
Accepted by ACM Multimedia 2021 as an oral paper