中文

场景感知的以自我为中心的三维人体姿态估计

计算机视觉与模式识别 2023-09-27 v3

摘要

使用单目头戴式鱼眼相机进行以自我为中心的三维人体姿态估计,因其在虚拟现实与增强现实中的众多应用而近期受到关注。现有方法在身体高度遮挡或与场景紧密交互等挑战性姿态下仍表现不佳。为解决此问题,我们提出一种场景感知的以自我为中心姿态估计方法,利用场景约束引导以自我为中心姿态的预测。为此,我们提出一个以自我为中心的深度估计网络,从广角以自我为中心鱼眼相机预测场景深度图,同时通过深度修复网络减轻人体的遮挡。接着,我们提出一个场景感知姿态估计网络,将场景的二维图像特征与估计深度图投影至体素空间,并通过 V2V 网络回归三维姿态。基于体素的特征表示提供了二维图像特征与场景几何之间的直接几何关联,并进一步促使 V2V 网络基于估计的场景几何约束预测姿态。为训练上述网络,我们还生成了一个名为 EgoGTA 的合成数据集,以及一个基于 EgoPW 的实拍数据集,称为 EgoPW-Scene。我们新评估序列的实验结果表明,所预测的以自我为中心三维姿态在人体-场景交互方面准确且物理上合理,证明我们的方法在定量与定性上均优于最先进的方法。

关键词

引用

@article{arxiv.2212.11684,
  title  = {Scene-aware Egocentric 3D Human Pose Estimation},
  author = {Jian Wang and Lingjie Liu and Weipeng Xu and Kripasindhu Sarkar and Diogo Luvizon and Christian Theobalt},
  journal= {arXiv preprint arXiv:2212.11684},
  year   = {2023}
}