通过融合自顶向下与自底向上网络实现单目3D多人姿态估计
计算机视觉与模式识别
2021-04-08 v2
摘要
在单目视频3D多人姿态估计中,人之间的遮挡和近距离交互会导致人体检测出错以及人体关节分组不可靠。现有的自顶向下方法依赖于人体检测,因此受这些问题影响。现有的自底向上方法不使用人体检测,但它们以相同尺度一次性处理所有人,导致对多人的尺度变化敏感。为应对这些挑战,我们提出融合自顶向下与自底向上方法以发挥各自优势。我们的自顶向下网络从图像块中估计所有人的人体关节而非仅一人,使其对可能出错的边界框具有鲁棒性。我们的自底向上网络融入基于人体检测的归一化热图,使网络在处理尺度变化时更鲁棒。最后,将自顶向下和自底向上网络估计的3D姿态输入我们的融合网络得到最终3D姿态。除融合自顶向下与自底向上网络外,不同于现有专为单人设计从而无法评估自然人际交互的姿态判别器,我们提出一种双人姿态判别器来强制自然的两人交互。最后,我们还应用半监督方法以克服3D真值数据稀缺的问题。我们的定量与定性评估显示了相较于最先进基线方法的有效性。
引用
@article{arxiv.2104.01797,
title = {Monocular 3D Multi-Person Pose Estimation by Integrating Top-Down and Bottom-Up Networks},
author = {Yu Cheng and Bo Wang and Bo Yang and Robby T. Tan},
journal= {arXiv preprint arXiv:2104.01797},
year = {2021}
}
备注
Accepted to CVPR 2021. Code is available at: https://github.com/3dpose/3D-Multi-Person-Pose