中文

LiCamPose:结合多视角 LiDAR 与 RGB 相机实现鲁棒的单时间戳 3D 人体姿态估计

计算机视觉与模式识别 2026-05-08 v4

摘要

已有多种方法被提出用于从多视角图像中估计 3D 人体姿态,并在相对简单条件下采集的公开数据集上取得了令人满意的性能。然而,研究从多模态输入(如 RGB 和点云数据)中提取 3D 人体骨架的方法有限。为弥补这一空白,我们引入了 LiCamPose,这是一个整合多视角 RGB 和稀疏点云信息,通过单帧估计鲁棒 3D 人体姿态的流程。我们展示了体素架构在结合这些模态方面的有效性。此外,为了规避对人工标注 3D 人体姿态的需求,我们开发了一个用于预训练的合成数据集生成器,并设计了一种无监督领域自适应策略,以在无需人工标注的情况下训练 3D 人体姿态估计器。为验证我们方法的泛化能力,我们在四个数据集上评估了 LiCamPose,包括两个公开数据集、一个合成数据集和一个名为 BasketBall 的具有挑战性的自采数据集,覆盖了多种场景。结果表明,LiCamPose 展现出卓越的泛化性能和巨大的应用潜力。相关代码、生成器和数据集将在论文被接收后公开。

关键词

引用

@article{arxiv.2312.06409,
  title  = {LiCamPose: Combining Multi-View LiDAR and RGB Cameras for Robust Single-timestamp 3D Human Pose Estimation},
  author = {Zhiyu Pan and Zhicheng Zhong and Wenxuan Guo and Yifan Chen and Jianjiang Feng and Jie Zhou},
  journal= {arXiv preprint arXiv:2312.06409},
  year   = {2026}
}

备注

Accepted by WACV2025