中文

面向人体动作复制的姿态引导人体动作复制

计算机视觉与模式识别 2024-06-25 v1

摘要

人体动作复制是人工智能和计算机视觉中一个引人入胜且具有挑战性的任务,旨在生成目标人物执行源人物动作的假视频。该问题本身具有挑战性,因为需要生成细微的人体纹理细节并且需要考虑时间一致性。现有方法通常采用带有 L1 或 L2 loss 的常规 GAN 来产生目标假视频,这本质上需要大量训练样本,而获取这些样本具有挑战性。与此同时,当前方法在实现真实图像细节和时间一致性方面仍存在困难,这不幸容易被人类观察者察觉。受此启发,我们从三个方面来解决问题:(1)我们通过感知 loss 和以理论为导师的 Gromov-Wasserstein loss 将姿态到外观的生成与约束桥接姿态与外观之间的差距。(2)我们在姿态到外观的生成中提出了一个 episodic 记忆模块,以推动持续学习,这有助于模型从其过去的差励生成中学习。我们还利用面部的几何线索来优化面部细节,并针对每个关键身体部位提供专门的局部 GAN 进行细化。(3)我们倡导以序列到序列方式而非单帧方式生成前景,显式地强制执行时间不一致。经验结果表明,我们的方法在五个数据集上(iPER、ComplexMotion、SoloDance、Fish 和 Mouse 数据集)能够生成逼真的目标视频,同时精确地复制来自源视频的动作。我们的方法显著优于最先进的方法,在 PSNR 和 FID 上分别获得了 7.2% 和 12.4% 的改进。

关键词

引用

@article{arxiv.2406.16601,
  title  = {Do As I Do: Pose Guided Human Motion Copy},
  author = {Sifan Wu and Zhenguang Liu and Beibei Zhang and Roger Zimmermann and Zhongjie Ba and Xiaosong Zhang and Kui Ren},
  journal= {arXiv preprint arXiv:2406.16601},
  year   = {2024}
}