HV-BEV:基于水平与垂直特征抽取的多视角3D目标检测方法
计算机视觉与模式识别
2025-08-01 v3
摘要
基于视觉的多视角环境感知系统的应用正在 autonomous driving 技术中受到越来越多的关注,尤其是基于 BEV(Bird's Eye View,鸟瞰图)的模型。当前的领先方法主要通过显式或隐式深度预测将每个摄像头视角的图像特征编码到 BEV 空间。然而,这些方法常常忽略了3D空间中不同对象部件之间的结构性关联,以及不同类别对象通常占据不同局部高度范围的事实。例如,卡车出现在较高的高度上,而交通锥则靠近地面。为此,本文提出了一种新方法,将 BEV 网格查询范式中的特征抽取解耦为水平特征聚合和垂直自适应高度感知参考点抽取(HV-BEV),旨在提高对对象完整信息的聚合能力和对不同对象高度分布的感知能力。具体而言,为每个3D参考点(位于地面对齐的水平平面上)动态构建一组相关的邻近点,从而增强同一实例在不同 BEV 网格之间的关联性,尤其是在该实例跨越围绕车辆的多个图像视角时。此外,与依赖于固定高度范围内均匀抽取不同,本文引入一个高度感知模块,融合历史信息,使参考点能够自适应地聚焦于不同场景中对象出现的不同高度。大量实验表明,我们提出的方法在 nuScenes 数据集上均优于基线方法。此外,我们的最佳模型在 nuScenes 测试集上实现了 50.5% 的 mAP 和 59.8% 的 NDS。代码已公开于 https://github.com/Uddd821/HV-BEV。
引用
@article{arxiv.2412.18884,
title = {HV-BEV: Decoupling Horizontal and Vertical Feature Sampling for Multi-View 3D Object Detection},
author = {Di Wu and Feng Yang and Benlian Xu and Pan Liao and Wenhui Zhao and Dingwen Zhang},
journal= {arXiv preprint arXiv:2412.18884},
year = {2025}
}
备注
13 pages, 7 figures, submitted to T-ITS