Inverse++: 基于 3D 对象检测辅助的面向视觉的 3D 语义占据预测
计算机视觉与模式识别
2025-04-08 v1 机器人学
摘要
3D 语义占据预测旨在使用自动驾驶车辆(AVs) onboard 的环视摄像头,对周围环境进行详细的几何和语义信息预测。现有方法主要关注复杂的内部结构模块设计以提高模型性能,如高效特征抽取和聚合过程或中间特征表示格式。在本文中,我们通过引入额外的 3D 对象检测辅助分支来引入额外的 3D 监督信号,探索多任务学习。这种额外的 3D 监督信号通过强化模型捕获场景中小型动态对象的中间特征能力来提升模型的整体性能,这些小型动态对象通常包括脆弱路用户,即自行车、摩托车和行人,其检测对于确保自动驾驶车辆的行车安全至关重要。在 nuScenes 数据集上进行的大量实验,包括具有挑战性的雨天和夜间场景,表明我们的方法取得了 state-of-the-art 结果,实现了 IoU 分数为 31.73% 和 mIoU 分数为 20.91%,并在检测脆弱路用户(VRU)方面表现突出。代码将在 https://github.com/DanielMing123/Inverse++ 公开。
引用
@article{arxiv.2504.04732,
title = {Inverse++: Vision-Centric 3D Semantic Occupancy Prediction Assisted with 3D Object Detection},
author = {Zhenxing Ming and Julie Stephany Berrio and Mao Shan and Stewart Worrall},
journal= {arXiv preprint arXiv:2504.04732},
year = {2025}
}