中文

自动驾驶中基于 2D 弱监督的多模态 3D 人体姿态估计

计算机视觉与模式识别 2021-12-23 v1

摘要

自动驾驶车辆(AV)中的 3D 人体姿态估计(HPE)在许多因素上不同于其他用例,包括数据的 3D 分辨率与范围、稠密深度图的缺失、LiDAR 的失效模式、相机与 LiDAR 间的相对位置,以及对估计精度的极高要求。因此,为其他用例(如虚拟现实、游戏和动画)收集的数据可能无法用于 AV 应用。这 necessitates 为 AV 中的 HPE 收集和标注大量 3D 数据,既耗时又昂贵。在本文中,我们提出首批缓解 AV 设定下此问题的方法之一。具体而言,我们提出一种多模态方法,使用 RGB 图像上的 2D 标签作为弱监督来执行 3D HPE。所提出的多模态架构将 LiDAR 与相机输入以及一个辅助分割分支相结合。在 Waymo Open Dataset 上,我们的方法相较仅相机的 2D HPE 基线取得了 22% 的相对提升,并较仅 LiDAR 模型有 6% 的提升。最后,细致的消融研究与基于部件的分析阐明了我们各项贡献的优势。

关键词

引用

@article{arxiv.2112.12141,
  title  = {Multi-modal 3D Human Pose Estimation with 2D Weak Supervision in Autonomous Driving},
  author = {Jingxiao Zheng and Xinwei Shi and Alexander Gorban and Junhua Mao and Yang Song and Charles R. Qi and Ting Liu and Visesh Chari and Andre Cornman and Yin Zhou and Congcong Li and Dragomir Anguelov},
  journal= {arXiv preprint arXiv:2112.12141},
  year   = {2021}
}