中文

HeightFormer:基于道路侧视角的语义对齐单目 3D 目标检测方法

计算机视觉与模式识别 2024-10-22 v2

摘要

车载 3D 目标检测技术因其在自动驾驶中的关键作用而受到广泛关注,但少数研究聚焦于将路边传感器应用于 3D 交通目标检测。现有研究通过基于锥体的高度估计实现 2D 图像特征到 3D 特征的投影,但未考虑高度对齐以及鸟瞰视图特征的提取效率。我们提出了一种新颖的 3D 目标检测框架,集成 Spatial Transformer 和 Voxel Pooling Transformer,以增强基于高度估计的 2D 到 3D 投影。我们在 Rope3D 和 DAIR-V2X-I 数据集上进行了大量实验,结果表明所提出算法在车辆和骑行者检测中表现优异。这些结果表明该算法在各种检测场景下都具有鲁棒性和普适性。提高道路侧 3D 目标检测的准确率有助于构建安全可靠的车路协同智能交通系统,并推动自动驾驶的大规模应用。代码和预训练模型将发布于 https://anonymous.4open.science/r/HeightFormer

关键词

引用

@article{arxiv.2410.07758,
  title  = {HeightFormer: A Semantic Alignment Monocular 3D Object Detection Method from Roadside Perspective},
  author = {Pei Liu and Zihao Zhang and Haipeng Liu and Nanfang Zheng and Meixin Zhu and Ziyuan Pu},
  journal= {arXiv preprint arXiv:2410.07758},
  year   = {2024}
}