中文

HeightFormer:基于 Transformer 学习体素特征中高度预测的路侧视角中心 3D 目标检测

计算机视觉与模式识别 2025-03-17 v1

摘要

路侧视角中心 3D 目标检测近年来受到越来越多的关注。它扩展了自动驾驶车辆的感知范围,提高了道路安全性。以前的方法 focus 于预测每个像素的高度而非深度,在路侧视觉感知方面取得了显著进展。然而,这受限于近大远小在图像特征中的透视特性,使得网络难以理解 3D 世界中物体的真实尺寸。BEV 特征和体素特征相较于图像特征更能真实反映 3D 世界中物体的分布。然而,BEV 特征因缺乏显式高度信息而倾向于丢失细节,体素特征计算成本较高。基于这一洞察,本文提出了一种通过 Transformer 学习体素特征中高度预测的高效框架,称为 HeightFormer。该方法将体素特征分组为局部高度序列,并利用注意力机制获取高度分布预测。随后,将局部高度序列重新组装以生成准确的 3D 特征。该方法应用于两个大规模路侧基准数据集 DAIR-V2X-I 和 Rope3D。进行了大量实验,HeightFormer 在路侧视角中心 3D 目标检测任务中超越了当前的 SOTA 方法。

关键词

引用

@article{arxiv.2503.10777,
  title  = {HeightFormer: Learning Height Prediction in Voxel Features for Roadside Vision Centric 3D Object Detection via Transformer},
  author = {Zhang Zhang and Chao Sun and Chao Yue and Da Wen and Yujie Chen and Tianze Wang and Jianghao Leng},
  journal= {arXiv preprint arXiv:2503.10777},
  year   = {2025}
}