CAM3DNet:多视角相机用于3D目标检测的多尺度特征综合挖掘
计算机视觉与模式识别
2026-04-21 v1
摘要
基于查询的3D目标检测方法使用多视角图像时,常常难以有效利用动态多尺度信息,例如,目标特征与查询几何关系的学习不足,直接探索多尺度时空特征会付出巨大的代价。为此,我们提出了CAM3DNet,一个新型稀疏查询框架,包含三个新模块:复合查询(CQ)、自适应注意力(ASA)和多尺度混合采样(MSHS)。首先,CQ模块的核心思想是一种多尺度投影策略,将2D查询转化为3D空间。其次,ASA模块学习时空多尺度查询之间的相互作用。第三,MSHS模块利用可变注意力机制,通过考虑多尺度查询、金字塔特征图和2D相机先验知识,对多尺度目标信息进行采样。整个模型采用 backbone 网络和特征金字塔网络(FPN)作为编码器,然后引入YOLOX和DepthNet作为ROI_Head产生CQ,并重复利用ASA和MSHS作为解码器获取检测特征。在nuScenes、Waymo和Argoverse基准数据集上的广泛实验表明了CAM3DNet的有效性,大多数现有基于相机的3D目标检测方法均被超越。此外,我们进行了全面的消融研究,检验CQ、ASA和MSHS的单独效果以及它们的空间和计算复杂度代价。
引用
@article{arxiv.2604.17024,
title = {CAM3DNet: Comprehensively mining the multi-scale features for 3D Object Detection with Multi-View Cameras},
author = {Mingxi Pang and Dingheng Wang and Zekun Li and Zhenping Sun and Bo Wang and Zhihang Wang and Zhao-Xu Yang},
journal= {arXiv preprint arXiv:2604.17024},
year = {2026}
}