基于层次多分辨率体素表示的高效摄像头-LiDAR 3D 语义占据预测方法 MR-Occ
计算机视觉与模式识别
2024-12-31 v1
摘要
准确的 3D 感知是理解自动驾驶环境中必不可少的技术。近期在 3D 语义占据预测领域的研究成果,借助摄像头-LiDAR 深度融合手段提升了鲁棒性和准确性。然而当前方法在所有体素上均均匀分配计算资源,导致效率低下,且未能充分解决遮挡问题,进而在挑战性场景中导致准确率下降。我们提出了 MR-Occ,这是一种基于摄像头-LiDAR 深度融合的 3D 语义占据预测新方法,通过三大关键组件解决上述挑战:层次体素特征细化 (Hierarchical Voxel Feature Refinement, HVFR)、多尺度占据解码器 (Multi-scale Occupancy Decoder, MOD) 和 像素到体素融合网络 (Pixel to Voxel Fusion Network, PVF-Net)。HVFR 通过增强关键体素的特征,提升性能并降低计算成本。MOD 引入一种“遮挡”类,以更好地处理传感器视野遮蔽区域,提高准确率。PVF-Net 利用稠密化 LiDAR 特征,通过可变形注意力机制有效融合摄像头和 LiDAR 数据。大量实验表明,MR-Occ 在 nuScenes-Occupancy 数据集上实现了最先进的性能,较前任方法在 IoU 上提升 5.2%,在 mIoU 上提升 5.3%,同时使用更少的参数和 FLOPs。此外,MR-Occ 在 SemanticKITTI 数据集上也表现出优异性能,进一步验证了其在多样化 3D 语义占据基准任务中的有效性与通用性。
引用
@article{arxiv.2412.20480,
title = {MR-Occ: Efficient Camera-LiDAR 3D Semantic Occupancy Prediction Using Hierarchical Multi-Resolution Voxel Representation},
author = {Minjae Seong and Jisong Kim and Geonho Bang and Hawook Jeong and Jun Won Choi},
journal= {arXiv preprint arXiv:2412.20480},
year = {2024}
}
备注
11 pages, 5 figures, 9 tables