中文

用于姿态引导人体图像生成与动画的深度空间变换

计算机视觉与模式识别 2021-12-01 v1

摘要

姿态引导人体图像生成与动画旨在将源人体图像变换为目标姿态。这些任务需要对源数据进行空间操控。然而,卷积神经网络因缺乏空间变换输入的能力而受限。本文提出一种可微分的全局流-局部注意力框架,在特征层面对输入进行重组。该框架首先估计源与目标之间的全局流场,随后通过内容感知的局部注意力系数采样相应的局部源特征块。我们表明,该框架能够高效地空间变换输入。同时,我们进一步为人体图像动画任务建模时间一致性,以生成连贯视频。图像生成与动画任务的实验结果均证明了模型的优越性。此外,新视角合成与人脸图像动画的额外结果表明,我们的模型适用于其他需要空间变换的任务。项目源代码见 https://github.com/RenYurui/Global-Flow-Local-Attention。

关键词

引用

@article{arxiv.2008.12606,
  title  = {Deep Spatial Transformation for Pose-Guided Person Image Generation and Animation},
  author = {Yurui Ren and Ge Li and Shan Liu and Thomas H. Li},
  journal= {arXiv preprint arXiv:2008.12606},
  year   = {2021}
}

备注

arXiv admin note: text overlap with arXiv:2003.00696