面向真实世界拥挤场景的人体姿态估计
计算机视觉与模式识别
2019-07-17 v1
摘要
随着深度卷积神经网络的采用,人体姿态估计近期取得显著进展。其诸多应用近年来引发巨大关注。然而,许多实际应用需要对人群进行姿态估计,这仍是一个鲜被解决的问题。本工作中,我们探索优化人群姿态估计的方法,聚焦于密集人群带来的挑战,如遮挡、彼此邻近的人员以及人员部分可见。为应对这些挑战,我们评估了姿态检测方法的三个方面:i) 引入遮挡鲁棒性的数据增强方法,ii) 对遮挡身体部位的显式检测,以及 iii) 合成生成数据集的使用。首个提升拥挤场景精度的方法是在训练时利用来自目标识别数据集COCO(Common Objects in Context)的人物与物体剪影生成遮挡。此外,评估了合成生成的JTA(Joint Track Auto)数据集在真实世界人群应用中的使用。为克服JTA因姿态多样性低与人群密度较小而产生的迁移鸿沟,我们创建了一个扩展数据集以简化真实世界应用的使用。另外,利用JTA提供的遮挡标志训练模型,该模型通过两个独立分支显式区分遮挡与可见身体部位。所提对基线方法的补充组合将总体精度提升4.7% AP,从而在相应数据集上提供与当前SOTA方法可比的结果。
引用
@article{arxiv.1907.06922,
title = {Human Pose Estimation for Real-World Crowded Scenarios},
author = {Thomas Golda and Tobias Kalb and Arne Schumann and Jürgen Beyerer},
journal= {arXiv preprint arXiv:1907.06922},
year = {2019}
}
备注
Accepted for the 16th IEEE International Conference on Advanced Video and Signal-based Surveillance (AVSS)