中文

基于时空注意力机制的多帧内容整合用于人物视频运动迁移

计算机视觉与模式识别 2019-08-13 v1

摘要

现有人物视频生成方法要么缺乏在外观与运动上控制的灵活性,要么无法保持细致外观与时间一致性。本文着手解决用于生成人物视频的运动迁移问题,其提供对外观与运动的控制。具体而言,我们将目标视频中一个人的运动迁移至源视频中的另一个人,同时保持源人物外观。不同于现有最先进方法仅依赖单张源帧,我们提出的方法基于时空注意力机制整合来自多张源帧的信息,以保留丰富的外观细节。除采用空间判别器以促使帧级保真外,还采用多范围时间判别器以强制生成视频在多个时间范围内类似于真实视频的时间动态。我们收集了一个具有挑战性的真实世界数据集,包含约 500 段具有复杂且不可预测运动的舞蹈视频片段,用于训练与测试。大量实验表明,所提方法能比以往方法生成更具照片真实感且时间一致性更好的人物视频。由于我们的方法将前景与背景的合成分解为两个分支,因此也可实现灵活的背景替换应用。

关键词

引用

@article{arxiv.1908.04013,
  title  = {Multi-Frame Content Integration with a Spatio-Temporal Attention Mechanism for Person Video Motion Transfer},
  author = {Kun Cheng and Hao-Zhi Huang and Chun Yuan and Lingyiqing Zhou and Wei Liu},
  journal= {arXiv preprint arXiv:1908.04013},
  year   = {2019}
}