点击即动:利用稀疏运动控制视频生成
计算机视觉与模式识别
2021-08-20 v1 人工智能
摘要
本文提出 Click to Move (C2M),一种新颖的视频生成框架,用户可通过鼠标点击指定场景关键物体的简单运动轨迹来控制合成视频的运动。我们的模型以初始帧、其对应的分割图以及编码用户输入的稀疏运动向量作为输入,输出从给定帧开始且运动与用户输入一致的合理视频序列。值得注意的是,我们提出的深度架构融入了图卷积网络 (GCN),以整体方式建模场景中所有物体的运动,并有效结合稀疏用户运动信息与图像特征。实验结果表明,C2M 在两个公开数据集上优于现有方法,从而证明了我们的 GCN 框架在建模物体交互方面的有效性。源代码公开于 https://github.com/PierfrancescoArdino/C2M。
引用
@article{arxiv.2108.08815,
title = {Click to Move: Controlling Video Generation with Sparse Motion},
author = {Pierfrancesco Ardino and Marco De Nadai and Bruno Lepri and Elisa Ricci and Stéphane Lathuilière},
journal= {arXiv preprint arXiv:2108.08815},
year = {2021}
}
备注
Accepted by International Conference on Computer Vision (ICCV 2021)