中文

NV3D:基于法线向量的空间形状驱动3D目标检测

计算机视觉与模式识别 2025-10-14 v1 人工智能 机器学习

摘要

最近的研究旨在通过利用多模态设置或从 LiDAR 点云中提取局部模式来丰富3D目标检测中的特征。然而,多模态方法在特征对齐方面面临重大挑战,同时在复杂的3D目标检测任务中获取局部特征可能过于简化。在本文中,我们提出了一种新模型NV3D,该模型利用来自体素邻居的局部特征,通过 K 最近邻(KNN)和主成分分析(PCA)计算每个体素基准上的法线向量。这种信息丰富的特征使NV3D能够确定表面与相关目标实体(包括汽车、行人或骑行者)之间的关系。在法线向量提取过程中,NV3D 提供了两种不同的采样策略:基于法线向量密度的采样和基于 FOV 的自适应区域采样,允许在保持性能的同时消除最多55%的数据。此外,我们应用了元素级注意力融合,该方法将体素特征作为查询和值,将法线向量特征作为键,类似于注意力机制。在KITI 数据集上进行训练,NV3D 在汽车和骑行者检测中表现优异,由于其空间形状。在验证集中,NV3D 在无采样情况下分别实现了86.60%和80.18%的平均精度(mAP),分别比基线 Voxel R-CNN 高出2.61%和4.23%的mAP。在两种采样方法下,NV3D 在汽车检测中实现了85.54%的mAP,超过基线1.56%的mAP,尽管大约过滤掉了55%的体素。

关键词

引用

@article{arxiv.2510.11632,
  title  = {NV3D: Leveraging Spatial Shape Through Normal Vector-based 3D Object Detection},
  author = {Krittin Chaowakarn and Paramin Sangwongngam and Nang Htet Htet Aung and Chalie Charoenlarpnopparut},
  journal= {arXiv preprint arXiv:2510.11632},
  year   = {2025}
}