中文

带注意力的 Liquid Warping GAN:人体图像合成的统一框架

计算机视觉与模式识别 2020-11-24 v2

摘要

我们在一个统一框架内处理人体图像合成,包括人体动作模仿、外观迁移和新视角合成。这意味着该模型一旦训练完成,即可用于处理所有这些任务。现有的特定任务方法主要使用 2D 关键点来估计人体结构。然而,它们仅表达位置信息,无法表征人物的个性化形状并对肢体旋转进行建模。在本文中,我们提出使用 3D 人体网格恢复模块来解耦姿态和形状。它不仅可以对关节位置和旋转进行建模,还可以表征个性化人体形状。为了保留源信息(如纹理、风格、颜色和面部身份),我们提出了一种带有注意力液体形变块的注意力液体形变 GAN,该块在图像空间和特征空间中将源信息传播到合成的参考图像中。具体而言,源特征由去噪卷积自编码器提取,以很好地表征源身份。此外,我们提出的方法支持来自多个源的更灵活的形变。为了进一步提高对未见源图像的泛化能力,应用了单样本/少样本对抗学习。具体而言,它首先在广泛的训练集中训练模型。然后,以自监督的方式用单样本/少样本未见图像微调模型,以生成高分辨率(512 x 512 和 1024 x 1024)结果。此外,我们构建了一个新数据集,即 iPER 数据集,用于评估人体动作模仿、外观迁移和新视角合成。大量实验证明了我们的方法在保留面部身份、形状一致性和衣服细节方面的有效性。所有代码和数据集可在 https://impersonator.org/work/impersonator-plus-plus.html 获取。

关键词

引用

@article{arxiv.2011.09055,
  title  = {Liquid Warping GAN with Attention: A Unified Framework for Human Image Synthesis},
  author = {Wen Liu and Zhixin Piao and Zhi Tu and Wenhan Luo and Lin Ma and Shenghua Gao},
  journal= {arXiv preprint arXiv:2011.09055},
  year   = {2020}
}

备注

Under review of IEEE Transactions on Pattern Analysis and Machine Intelligence. arXiv admin note: text overlap with arXiv:1909.12224