面向单目3D目标检测的高效特征聚合与尺度感知回归
计算机视觉与模式识别
2026-02-16 v3
摘要
单目3D目标检测因其简单性和低成本而备受关注。现有方法通常遵循传统的2D检测范式,首先定位目标中心,然后通过邻域特征预测3D属性。然而,这些方法主要依赖于渐进式跨尺度特征聚合,并且仅关注局部信息,可能导致缺乏全局感知并遗漏小尺度目标。此外,由于不同场景和深度下目标尺度变化较大,不准确的感受野常常导致背景噪声和特征表示退化。为解决这些问题,我们提出了MonoASRH,一种新颖的单目3D检测框架,由高效混合特征聚合模块和自适应尺度感知3D回归头组成。具体而言,EH-FAM采用具有全局感受野的多头注意力来提取小尺度目标的语义特征,并利用轻量级卷积模块高效聚合不同尺度的视觉特征。ASRH编码2D边界框尺寸,然后通过尺度-语义特征融合模块将尺度特征与EH-FAM聚合的语义特征融合。尺度-语义特征融合模块引导ASRH学习动态感受野偏移,将尺度先验融入3D位置预测,以实现更好的尺度感知。在KITTI和Waymo数据集上的大量实验表明,MonoASRH达到了最先进的性能。
引用
@article{arxiv.2411.02747,
title = {Efficient Feature Aggregation and Scale-Aware Regression for Monocular 3D Object Detection},
author = {Yifan Wang and Xiaochen Yang and Fanqi Pu and Qingmin Liao and Wenming Yang},
journal= {arXiv preprint arXiv:2411.02747},
year = {2026}
}