用于人体姿态的视角不变、遮挡鲁棒的概率嵌入
摘要
对人体姿态与动作的识别对于自主系统与人顺畅交互至关重要。然而,相机通常将人体姿态作为图像和视频以 2D 形式捕捉,其外观在不同视角下可能存在显著变化,使识别任务具有挑战性。为此,我们探索从 2D 信息中识别 3D 人体姿态的相似性,这在现有工作中尚未得到充分研究。在此,我们提出一种从 2D 身体关节关键点学习紧凑的视角不变嵌入空间的方法,而无需显式预测 3D 姿态。来自投影和遮挡的 2D 姿态的输入歧义难以通过确定性映射表示,因此我们为嵌入空间采用概率形式。实验结果表明,与其他 3D 姿态估计模型相比,我们的嵌入模型在不同相机视角下检索相似姿态时取得了更高的准确率。我们还表明,通过训练一个简单的时序嵌入模型,我们在姿态序列检索上取得了优越性能,并大幅降低了基于堆叠帧嵌入的嵌入维度,以实现高效的大规模检索。此外,为使我们的嵌入能处理部分可见输入,我们进一步研究了训练期间不同的关键点遮挡增强策略。我们证明这些遮挡增强显著提升了在部分 2D 输入姿态上的检索性能。在动作识别和视频对齐上的结果表明,使用我们的嵌入而无需任何额外训练,即可取得相对于专为各任务训练的其他模型具有竞争力的性能。
引用
@article{arxiv.2010.13321,
title = {View-Invariant, Occlusion-Robust Probabilistic Embedding for Human Pose},
author = {Ting Liu and Jennifer J. Sun and Long Zhao and Jiaping Zhao and Liangzhe Yuan and Yuxiao Wang and Liang-Chieh Chen and Florian Schroff and Hartwig Adam},
journal= {arXiv preprint arXiv:2010.13321},
year = {2021}
}
备注
Accepted to International Journal of Computer Vision (IJCV). Code is available at https://github.com/google-research/google-research/tree/master/poem. Video synchronization results are available at https://drive.google.com/corp/drive/folders/1nhPuEcX4Lhe6iK3nv84cvSCov2eJ52Xy. arXiv admin note: text overlap with arXiv:1912.01001