中文

VoxelKP: 一种用于 LiDAR 数据中人体关键点估计的体素网络架构

计算机视觉与模式识别 2023-12-15 v1

摘要

我们提出了 \textit{VoxelKP},一种专为 LiDAR 数据中人体关键点估计设计的新型全稀疏网络架构。核心挑战在于物体在三维空间中稀疏分布,而人体关键点检测需要在人体存在的任何位置获取详细的局部信息。本文提出了四个新颖的想法。首先,我们提出稀疏选择性核以捕捉多尺度上下文。其次,我们引入稀疏框注意力,以专注于学习每个人体实例内关键点之间的空间相关性。第三,我们结合了空间编码,在将三维体素投影到编码鸟瞰图的二维网格时利用绝对三维坐标。最后,我们提出混合特征学习,将逐体素特征处理与稀疏卷积相结合。我们在 Waymo 数据集上评估了该方法,在 MPJPE 指标上相比在相同数据上训练的 SOTA 方法 \textit{HUM3DIL} 提升了 27%27\%,相比在 25×25\times 更大数据集上预训练的 SOTA 方法 \textit{GC-KPL} 提升了 12%12\%。据我们所知,\textit{VoxelKP} 是首个专门为解决 LiDAR 数据三维关键点估计这一挑战性任务而设计的单阶段全稀疏网络,并实现了 SOTA 性能。代码可在 \url{https://github.com/shijianjian/VoxelKP} 获取。

关键词

引用

@article{arxiv.2312.08871,
  title  = {VoxelKP: A Voxel-based Network Architecture for Human Keypoint Estimation in LiDAR Data},
  author = {Jian Shi and Peter Wonka},
  journal= {arXiv preprint arXiv:2312.08871},
  year   = {2023}
}