中文

基于多深度传感器的视点无关人体检测与姿态估计

计算机视觉与模式识别 2020-05-12 v1 机器学习 图像与视频处理

摘要

基于点云的方法在自动驾驶中的 3D 目标检测等领域产生了有前景的结果。然而,最近的大多数点云工作集中于单深度传感器数据,而针对室内监控应用(如医院手术室监控或室内监视)的工作较少。在这些场景中,通常使用多个摄像机来解决遮挡问题。我们提出了一种使用多个点云源的端到端多人 3D 姿态估计网络 Point R-CNN。我们进行了广泛的实验,利用 CMU panoptic 数据集和 MVOR 手术室数据集模拟具有挑战性的真实世界案例,如单个摄像机故障、各种目标外观以及复杂的杂乱场景。与以往大多数试图通过构建复杂融合模型来利用多传感器信息(这通常导致泛化能力差)的方法不同,我们利用拼接点云的效率在输入层面融合信息。同时,我们展示了我们的端到端网络大大优于级联的 SOTA 模型。

关键词

引用

@article{arxiv.2005.04258,
  title  = {View Invariant Human Body Detection and Pose Estimation from Multiple Depth Sensors},
  author = {Walid Bekhtaoui and Ruhan Sa and Brian Teixeira and Vivek Singh and Klaus Kirchberg and Yao-jen Chang and Ankur Kapoor},
  journal= {arXiv preprint arXiv:2005.04258},
  year   = {2020}
}