中文

DAOcc:辅助3D目标检测的多传感器融合用于3D占据预测

计算机视觉与模式识别 2025-09-24 v4

摘要

多传感器融合显著提升了3D语义占据预测的准确性和鲁棒性,这对于自动驾驶和机器人人来说至关重要。然而,大多数现有方法依赖高分辨率图像和复杂网络才能实现顶级性能,阻碍了其在实际场景中的部署。此外,当前的多传感器融合方法主要关注改进特征融合,而大量忽略了对这些特征有效监督策略的探索。为此,我们提出了DAOcc,这是一个新的多模态占据预测框架,利用3D目标检测监督信号辅助实现卓越性能,同时采用部署友好的图像主干网络和实用的输入分辨率。此外,我们引入了BEV视图范围扩展策略以缓解较低图像分辨率导致的性能下降。广泛的实验表明,DAOcc在Occ3D-nuScenes和Occ3D-Waymo基准测试中均实现了新的最佳结果,使用仅ResNet-50主干网络和256×704输入分辨率即可显著优于之前的最佳方法。在TensorRT优化后,DAOcc在NVIDIA RTX 4090 GPU上实现104.9 FPS,保持54.2 mIoU。代码已公开:https://github.com/AlphaPlusTT/DAOcc。

关键词

引用

@article{arxiv.2409.19972,
  title  = {DAOcc: 3D Object Detection Assisted Multi-Sensor Fusion for 3D Occupancy Prediction},
  author = {Zhen Yang and Yanpeng Dong and Jiayu Wang and Heng Wang and Lichao Ma and Zijian Cui and Qi Liu and Haoran Pei and Kexin Zhang and Chao Zhang},
  journal= {arXiv preprint arXiv:2409.19972},
  year   = {2025}
}

备注

TCSVT Accepted version (not the final published version)