从单视图 RGBD 进行三维人体网格估计
计算机视觉与模式识别
2025-08-13 v2
摘要
尽管从 RGB 图像进行三维人体网格估计取得了显著进展,但提供额外深度数据的 RGBD 相机仍未得到充分利用。在本文中,我们提出了一种从单个 RGBD 视图进行精确三维人体网格估计的方法,利用 RGBD 相机的经济性和广泛普及性来服务于现实世界应用。针对此问题的全监督方法需要一个包含 RGBD 图像和三维网格标签对的数据集。然而,收集这样的数据集成本高昂且具有挑战性,因此现有数据集规模小,且在姿态和形状多样性方面有限。为了克服这种数据稀缺性,我们利用现有的运动捕捉(MoCap)数据集。我们首先从 MoCap 数据集中找到的身体模型获取完整的三维网格,并通过投影到虚拟相机来创建它们的部分单视图版本。这模拟了 RGBD 相机从单一视点提供的深度数据。然后,我们训练一个掩码自编码器来完成这个部分的单视图网格。在推理过程中,我们的方法(我们将其命名为 M,即“掩码网格建模”)将来自传感器的深度值与模板人体网格的顶点进行匹配,从而创建一个部分的单视图网格。我们有效地恢复了三维人体网格模型中不可见的部分,从而得到一个完整的身体网格。M 在 SURREAL 和 CAPE 数据集上分别达到了 16.8 毫米和 22.0 毫米的每顶点误差(PVE),优于使用全身点云作为输入的现有方法。我们在 BEHAVE 数据集上获得了具有竞争力的 70.9 PVE,比最近发布的基于 RGB 的方法高出 18.4 毫米,突显了深度数据的实用性。代码将开源。
引用
@article{arxiv.2508.08178,
title = {3D Human Mesh Estimation from Single View RGBD},
author = {Ozhan Suat and Bedirhan Uguz and Batuhan Karagoz and Muhammed Can Keles and Emre Akbas},
journal= {arXiv preprint arXiv:2508.08178},
year = {2025}
}