基于显式遮挡训练的时空网络三维人体姿态估计
计算机视觉与模式识别
2020-04-27 v1
摘要
尽管近年来取得了显著进展,从单目视频中估计三维姿态仍然是一项具有挑战性的任务。一般而言,当目标人物相对于训练数据的尺度和速度过小/过大,或运动过快/过慢时,现有方法的性能会下降。此外,据我们所知,许多这些方法并未在严重遮挡下进行显式设计或训练,导致其在处理遮挡时的性能受限。针对这些问题,我们提出了一种用于鲁棒三维人体姿态估计的时空网络。由于视频中的人物可能以不同尺度出现并具有不同的运动速度,我们在每帧中应用多尺度空间特征预测二维关节或关键点,并采用多步长时序卷积网络(TCNs)估计三维关节或关键点。此外,我们设计了一个基于身体结构和肢体运动的时空判别器,以评估预测姿态是否构成有效姿态和有效运动。在训练期间,我们显式地掩码掉部分关键点以模拟从轻微到严重的各种遮挡情况,从而使我们的网络能更好地学习并对不同程度的遮挡具有鲁棒性。由于三维真值数据有限,我们进一步利用二维视频数据为网络注入半监督学习能力。在公开数据集上的实验验证了方法的有效性,我们的消融研究展示了网络各子模块的优势。
引用
@article{arxiv.2004.11822,
title = {3D Human Pose Estimation using Spatio-Temporal Networks with Explicit Occlusion Training},
author = {Yu Cheng and Bo Yang and Bo Wang and Robby T. Tan},
journal= {arXiv preprint arXiv:2004.11822},
year = {2020}
}
备注
8 pages, AAAI 2020