中文

基于单目相机与单台激光雷达的大规模场景弱监督三维多人姿态估计

计算机视觉与模式识别 2022-12-01 v1

摘要

对于基于单目相机的三维多人姿态估计,深度估计通常是病态且模糊的。由于激光雷达(LiDAR)能够捕获远距离场景中的精确深度信息,其可通过提供丰富的几何特征而有益于个体的全局定位与三维姿态估计。受此启发,我们提出了一种基于单目相机与单台LiDAR的大规模场景三维多人姿态估计方法,其易于部署且对光照不敏感。具体而言,我们设计了一种有效的融合策略以利用包括图像与点云的多模态输入数据,并充分利用时序信息引导网络学习自然且连贯的人体运动。在不依赖任何三维姿态标注的情况下,我们的方法利用点云的固有几何约束进行自监督,并利用图像上的二维关键点进行弱监督。在公开数据集与我们新收集数据集上的大量实验证明了所提方法的优越性与泛化能力。

关键词

引用

@article{arxiv.2211.16951,
  title  = {Weakly Supervised 3D Multi-person Pose Estimation for Large-scale Scenes based on Monocular Camera and Single LiDAR},
  author = {Peishan Cong and Yiteng Xu and Yiming Ren and Juze Zhang and Lan Xu and Jingya Wang and Jingyi Yu and Yuexin Ma},
  journal= {arXiv preprint arXiv:2211.16951},
  year   = {2022}
}

备注

Accepted by AAAI 2023