Doracamom:基于多视角4D雷达与摄像机的联合3D检测与占用预测框架用于全向感知
计算机视觉与模式识别
2026-01-21 v3
摘要
3D目标检测和占用预测是自动驾驶中的关键任务,受到广泛关注。尽管近期基于视觉的方法具有潜力,但在恶劣条件下仍面临挑战。因此,集成摄像机与下一代4D成像雷达以实现统一的多任务感知具有重要意义,尽管该领域的研究仍有限。本文提出Doracamom,即首个融合多视角摄像机和4D雷达进行联合3D目标检测和语义占用预测的框架,实现全面环境感知。具体而言,我们引入一种新颖的粗糙体素查询生成器(Coarse Voxel Queries Generator),将4D雷达的几何先验与图像的语义特征相结合,以初始化体素查询,为后续基于Transformer的细化奠定稳健基础。为充分利用时序信息,我们设计了双分支时序编码器(Dual-Branch Temporal Encoder),在BEV空间和体素空间中并行处理多模态时序特征,实现全面的时空表征学习。此外,我们提出了跨模态BEV-体素融合模块(Cross-Modal BEV-Voxel Fusion module),通过注意力机制自适应融合互补特征,并采用辅助任务提高特征质量。在OmniHD-Scenes、View-of-Delft(VoD)和TJ4DRadSet数据集上的大量实验表明,Doracamom在两个任务上均实现了最先进的性能,为多模态3D感知树立了新基准。代码和模型将公开提供。
引用
@article{arxiv.2501.15394,
title = {Doracamom: Joint 3D Detection and Occupancy Prediction with Multi-view 4D Radars and Cameras for Omnidirectional Perception},
author = {Lianqing Zheng and Jianan Liu and Runwei Guan and Long Yang and Shouyi Lu and Yuanzhe Li and Xiaokai Bai and Jie Bai and Zhixiong Ma and Hui-Liang Shen and Xichan Zhu},
journal= {arXiv preprint arXiv:2501.15394},
year = {2026}
}
备注
Accepted by IEEE TCSVT