VoxelKP: 一种用于 LiDAR 数据中人体关键点估计的体素网络架构
计算机视觉与模式识别
2023-12-15 v1
摘要
我们提出了 \textit{VoxelKP},一种专为 LiDAR 数据中人体关键点估计设计的新型全稀疏网络架构。核心挑战在于物体在三维空间中稀疏分布,而人体关键点检测需要在人体存在的任何位置获取详细的局部信息。本文提出了四个新颖的想法。首先,我们提出稀疏选择性核以捕捉多尺度上下文。其次,我们引入稀疏框注意力,以专注于学习每个人体实例内关键点之间的空间相关性。第三,我们结合了空间编码,在将三维体素投影到编码鸟瞰图的二维网格时利用绝对三维坐标。最后,我们提出混合特征学习,将逐体素特征处理与稀疏卷积相结合。我们在 Waymo 数据集上评估了该方法,在 MPJPE 指标上相比在相同数据上训练的 SOTA 方法 \textit{HUM3DIL} 提升了 ,相比在 更大数据集上预训练的 SOTA 方法 \textit{GC-KPL} 提升了 。据我们所知,\textit{VoxelKP} 是首个专门为解决 LiDAR 数据三维关键点估计这一挑战性任务而设计的单阶段全稀疏网络,并实现了 SOTA 性能。代码可在 \url{https://github.com/shijianjian/VoxelKP} 获取。
引用
@article{arxiv.2312.08871,
title = {VoxelKP: A Voxel-based Network Architecture for Human Keypoint Estimation in LiDAR Data},
author = {Jian Shi and Peter Wonka},
journal= {arXiv preprint arXiv:2312.08871},
year = {2023}
}