基于多视图未标定深度相机的多人 3D 姿态估计
计算机视觉与模式识别
2024-01-30 v1
摘要
我们处理从有限数量的未标定深度相机进行多视图、多人 3D 人体姿态估计的任务。最近,提出了许多基于多视图 RGB 相机的 3D 人体姿态估计方法。然而,这些工作 (1) 假设 RGB 相机视图数量足以进行 3D 重建,(2) 相机已标定,以及 (3) 依赖真实 3D 姿态来训练其回归模型。在本工作中,我们提出利用提供 RGBD 视频流的稀疏、未标定深度相机进行 3D 人体姿态估计。我们提出了一个用于多视图深度人体姿态估计 (MVD-HPE) 的简单流水线,无需训练深度 3D 人体姿态回归模型即可联合预测相机姿态和 3D 人体姿态。与仅使用 RGB 特征相比,该框架利用来自 RGBD 图像的 3D Re-ID 外观特征来构建更准确的对应关系(用于推导相机位置)。我们进一步提出 (1) 利用 3D 刚体变换作为引导的深度引导相机姿态估计,以及 (2) 利用深度投影 3D 点作为优化替代目标的深度约束 3D 人体姿态估计。为了评估我们提出的流水线,我们收集了由多个稀疏视图深度相机录制的一系列 RGBD 视频集,并手动标注了真实 3D 姿态。实验表明,我们提出的方法在相机姿态估计和 3D 人体姿态估计方面均优于当前无回归的 3D 人体姿态流水线。
引用
@article{arxiv.2401.15616,
title = {Multi-Person 3D Pose Estimation from Multi-View Uncalibrated Depth Cameras},
author = {Yu-Jhe Li and Yan Xu and Rawal Khirodkar and Jinhyung Park and Kris Kitani},
journal= {arXiv preprint arXiv:2401.15616},
year = {2024}
}
备注
17 pages including appendix