中文

用于3D人体姿态估计的多尺度网络与推理阶段优化

计算机视觉与模式识别 2020-10-20 v2

摘要

从单目视频估计3D人体姿态仍是一项具有挑战性的任务。许多现有方法在目标人物被其他物体遮挡,或运动相对于训练数据的尺度和速度过快/过慢时性能下降。此外,这些方法大多未针对严重遮挡显式设计或训练,使其处理遮挡的性能受限。针对这些问题,我们引入一种时空网络以实现鲁棒的3D人体姿态估计。由于视频中的人体可能以不同尺度出现并具有不同运动速度,我们在每帧中应用多尺度空间特征预测2D关节或关键点,并采用多步长时空卷积网络(TCNs)估计3D关节或关键点。进一步,我们设计基于身体结构及肢体运动的时空判别器,以评估预测姿态是否构成有效姿态与有效运动。训练期间,我们显式掩蔽部分关键点以模拟从轻微到严重的各种遮挡情形,使网络学得更好并对不同程度遮挡鲁棒。由于3D真值数据有限,我们进一步利用2D视频数据赋予网络半监督学习能力。此外,我们观察到因视频与图像训练数据集间姿态差异,3D姿态预测与2D姿态估计间存在偏差。因此我们提出基于置信度的推理阶段优化,自适应地强制3D姿态投影匹配2D姿态估计,以进一步提升最终姿态预测精度。公开数据集上的实验验证了方法有效性,消融研究展示了网络各子模块的优势。

关键词

引用

@article{arxiv.2010.06844,
  title  = {Multi-Scale Networks for 3D Human Pose Estimation with Inference Stage Optimization},
  author = {Cheng Yu and Bo Wang and Bo Yang and Robby T. Tan},
  journal= {arXiv preprint arXiv:2010.06844},
  year   = {2020}
}

备注

14 pages, 13 figures. arXiv admin note: substantial text overlap with arXiv:2004.11822