中文

用于真实场景精确三维人体姿态与形状估计的合成训练

计算机视觉与模式识别 2020-09-23 v2

摘要

本文解决从RGB图像进行单目三维人体形状与姿态估计的问题。尽管该领域在姿态预测精度方面取得巨大进展,最先进的方法常预测出不准确的身体形状。我们认为这主要归因于缺乏具有多样且准确身体形状标签的真实场景训练数据。因此,我们提出STRAPS(Synthetic Training for Real Accurate Pose and Shape,用于真实精确姿态与形状的合成训练),一种利用代理表示(如轮廓与2D关节)作为形状与姿态回归神经网络输入的系统,该网络使用合成训练数据(训练期间利用SMPL统计身体模型动态生成)进行训练,以克服数据稀缺。我们通过训练期间的数据增强与损坏,弥合合成训练输入与测试时由关键点检测及分割CNN预测的含噪真实输入之间的差距。为评估我们的方法,我们整理并提供了一个具挑战性的单目人体形状估计评测数据集Sports Shape and Pose 3D(SSP-3D)。其由紧身着装、具多种身体形状的运动员RGB图像及相应的伪真值SMPL形状与姿态参数组成,后者通过多帧优化获得。我们表明STRAPS在SSP-3D上于形状预测精度方面优于其他最先进方法,同时在以姿态为中心的数据集与指标上保持与最先进方法的竞争力。

关键词

引用

@article{arxiv.2009.10013,
  title  = {Synthetic Training for Accurate 3D Human Pose and Shape Estimation in the Wild},
  author = {Akash Sengupta and Ignas Budvytis and Roberto Cipolla},
  journal= {arXiv preprint arXiv:2009.10013},
  year   = {2020}
}

备注

14 pages, 7 figures, BMVC 2020, Fixed abstract typos