LPFormer:基于多任务网络的 LiDAR 姿态估计 Transformer
计算机视觉与模式识别
2024-03-05 v2
摘要
由于难以获取大规模 3D 人体关键点标注,以往的 3D 人体姿态估计(HPE)方法常依赖于 2D 图像特征和顺序 2D 标注。此外,这些网络的训练通常假设预测人体边界框以及 3D 点云与 2D 图像的精确对齐,使得直接应用于真实场景具有挑战性。本文中,我们提出了首个端到端 3D 人体姿态估计框架 LPFormer,其仅以 LiDAR 及其对应 3D 标注作为输入。LPFormer 包括两个阶段:首先识别人体边界框并提取多级特征表示,然后利用基于 transformer 的网络根据这些特征预测人体关键点。我们的方法表明,3D HPE 可无缝集成到强大的 LiDAR 感知网络中,并受益于该网络提取的特征。在 Waymo Open Dataset 上的实验结果表明了最先进(SOTA)性能,甚至优于以往的多模态方案。
引用
@article{arxiv.2306.12525,
title = {LPFormer: LiDAR Pose Estimation Transformer with Multi-Task Network},
author = {Dongqiangzi Ye and Yufei Xie and Weijia Chen and Zixiang Zhou and Lingting Ge and Hassan Foroosh},
journal= {arXiv preprint arXiv:2306.12525},
year = {2024}
}
备注
ICRA 2024. Top solution for the Waymo Open Dataset Challenges 2023 - Pose Estimation. CVPR 2023 Workshop on Autonomous Driving