InstanceBEV:统一实例与 BEV 表示以实现 3D 全景分割
计算机视觉与模式识别
2025-09-24 v2
摘要
基于 BEV 的 3D 感知已成为端到端自动驾驶研究的热点。然而,现有的 BEV 方法因特征空间巨大而面临显著挑战,使得高效建模变得困难,并阻碍了全局注意力机制的有效集成。我们提出了一种新的建模策略 InstanceBEV,它协同结合了以地图为中心的方法和以对象为中心的方法的优势。我们的方法在 BEV 特征中有效提取实例级特征,促进在高度压缩的特征空间中实现全局注意力建模,从而解决以地图为中心的全局建模固有的效率挑战。此外,我们的方法在不引入额外模块的情况下实现了有效的多任务学习。我们通过预测占用率来验证所提模型的效率和准确性,通过结合实例信息实现 3D 占用全景分割。在 OCC3D-nuScenes 数据集上的实验结果表明,InstanceBEV 仅使用 8 帧即实现了 15.3 的 RayPQ 和 38.2 的 RayIoU。这超越了 SparseOcc 的 RayPQ 9.3% 和 RayIoU 10.7%,展示了多任务协同的有效性。
引用
@article{arxiv.2505.13817,
title = {InstanceBEV: Unifying Instance and BEV Representation for 3D Panoptic Segmentation},
author = {Feng Li and Zhaoyue Wang and Enyuan Zhang and Mohammad Masum Billah and Yunduan Cui and Kun Xu},
journal= {arXiv preprint arXiv:2505.13817},
year = {2025}
}