中文

基于级联维度提升的单目深度3D人体姿态估计

计算机视觉与模式识别 2021-04-09 v1

摘要

从单幅图像进行3D姿态估计因深度歧义性而具挑战性。以往的一类方法借助外部2D姿态检测器获得2D关节点,再将其提升(lift)至3D空间。然而,此类方法丢弃了图像上下文信息,而后者是3D姿态估计的强线索。同时,另一些方法直接从单目图像预测关节点,但采用2.5D输出表示P2.5D=(u,v,zr)P^{2.5D} = (u,v,z^{r}),其中uuvv位于图像空间,而zrz^{r}位于根相对3D空间。因此,通常利用真值信息(例如根关节点距相机的深度)将2.5D输出变换至3D空间,这限制了其实用性。本工作中,我们提出一种新颖的端到端框架,其不仅利用上下文信息,且通过级联维度提升直接在3D空间产生输出。具体而言,我们将从2D图像空间向3D空间提升姿态的任务分解为若干顺序子任务:1)2D空间中的运动学骨架与独立关节点估计,2)根相对深度估计,3)提升至3D空间,每一子任务均采用直接监督与上下文图像特征来引导学习过程。大量实验表明,所提框架在两个广泛使用的3D人体姿态数据集(Human3.6M、MuPoTS-3D)上取得了最先进的性能。

关键词

引用

@article{arxiv.2104.03520,
  title  = {Deep Monocular 3D Human Pose Estimation via Cascaded Dimension-Lifting},
  author = {Changgong Zhang and Fangneng Zhan and Yuan Chang},
  journal= {arXiv preprint arXiv:2104.03520},
  year   = {2021}
}

备注

3 figures, 4 tables