用于姿态引导人体图像生成与动画的深度空间变换
计算机视觉与模式识别
2021-12-01 v1
摘要
姿态引导人体图像生成与动画旨在将源人体图像变换为目标姿态。这些任务需要对源数据进行空间操控。然而,卷积神经网络因缺乏空间变换输入的能力而受限。本文提出一种可微分的全局流-局部注意力框架,在特征层面对输入进行重组。该框架首先估计源与目标之间的全局流场,随后通过内容感知的局部注意力系数采样相应的局部源特征块。我们表明,该框架能够高效地空间变换输入。同时,我们进一步为人体图像动画任务建模时间一致性,以生成连贯视频。图像生成与动画任务的实验结果均证明了模型的优越性。此外,新视角合成与人脸图像动画的额外结果表明,我们的模型适用于其他需要空间变换的任务。项目源代码见 https://github.com/RenYurui/Global-Flow-Local-Attention。
引用
@article{arxiv.2008.12606,
title = {Deep Spatial Transformation for Pose-Guided Person Image Generation and Animation},
author = {Yurui Ren and Ge Li and Shan Liu and Thomas H. Li},
journal= {arXiv preprint arXiv:2008.12606},
year = {2021}
}
备注
arXiv admin note: text overlap with arXiv:2003.00696