PoP-Net:基于部件位姿的从深度图像进行多人三维姿态估计网络
计算机视觉与模式识别
2021-11-29 v2
摘要
本文提出一种称为 PoP-Net 的实时方法,用于从深度图像预测多人三维姿态。PoP-Net 学习在一次前向推理中自下而上地预测部件表示和自上而下地预测全局姿态。具体而言,引入了一种称为截断部件位移场(Truncated Part Displacement Field, TPDF)的新部件级表示,其支持显式融合过程,以统一自下而上部件检测与全局姿态检测的优势。同时,引入一种有效的模式选择方案,自动解决全局姿态与部件检测之间的冲突情况。最后,由于缺少用于开发多人三维姿态估计的高质量深度数据集,我们引入了多人三维人体姿态数据集(Multi-Person 3D Human Pose Dataset, MP-3DHP)作为新基准。MP-3DHP 旨在实现模型训练中有效的多人与背景数据增强,并在非受控多人场景下评估三维人体姿态估计器。我们表明 PoP-Net 在 MP-3DHP 与广泛使用的 ITOP 数据集上均取得最先进(state-of-the-art, SOTA)结果,且在多人处理效率上具有显著优势。为展示我们算法流程的应用之一,我们还给出了由计算得到的三维关节位置驱动的虚拟化身结果。MP-3DHP 数据集与评估代码已发布于:https://github.com/oppo-us-research/PoP-Net。
引用
@article{arxiv.2012.06734,
title = {PoP-Net: Pose over Parts Network for Multi-Person 3D Pose Estimation from a Depth Image},
author = {Yuliang Guo and Zhong Li and Zekun Li and Xiangyu Du and Shuxue Quan and Yi Xu},
journal= {arXiv preprint arXiv:2012.06734},
year = {2021}
}