中文

LPFormer:基于多任务网络的 LiDAR 姿态估计 Transformer

计算机视觉与模式识别 2024-03-05 v2

摘要

由于难以获取大规模 3D 人体关键点标注,以往的 3D 人体姿态估计(HPE)方法常依赖于 2D 图像特征和顺序 2D 标注。此外,这些网络的训练通常假设预测人体边界框以及 3D 点云与 2D 图像的精确对齐,使得直接应用于真实场景具有挑战性。本文中,我们提出了首个端到端 3D 人体姿态估计框架 LPFormer,其仅以 LiDAR 及其对应 3D 标注作为输入。LPFormer 包括两个阶段:首先识别人体边界框并提取多级特征表示,然后利用基于 transformer 的网络根据这些特征预测人体关键点。我们的方法表明,3D HPE 可无缝集成到强大的 LiDAR 感知网络中,并受益于该网络提取的特征。在 Waymo Open Dataset 上的实验结果表明了最先进(SOTA)性能,甚至优于以往的多模态方案。

关键词

引用

@article{arxiv.2306.12525,
  title  = {LPFormer: LiDAR Pose Estimation Transformer with Multi-Task Network},
  author = {Dongqiangzi Ye and Yufei Xie and Weijia Chen and Zixiang Zhou and Lingting Ge and Hassan Foroosh},
  journal= {arXiv preprint arXiv:2306.12525},
  year   = {2024}
}

备注

ICRA 2024. Top solution for the Waymo Open Dataset Challenges 2023 - Pose Estimation. CVPR 2023 Workshop on Autonomous Driving