中文

InstanceBEV:统一实例与 BEV 表示以实现 3D 全景分割

计算机视觉与模式识别 2025-09-24 v2

摘要

基于 BEV 的 3D 感知已成为端到端自动驾驶研究的热点。然而,现有的 BEV 方法因特征空间巨大而面临显著挑战,使得高效建模变得困难,并阻碍了全局注意力机制的有效集成。我们提出了一种新的建模策略 InstanceBEV,它协同结合了以地图为中心的方法和以对象为中心的方法的优势。我们的方法在 BEV 特征中有效提取实例级特征,促进在高度压缩的特征空间中实现全局注意力建模,从而解决以地图为中心的全局建模固有的效率挑战。此外,我们的方法在不引入额外模块的情况下实现了有效的多任务学习。我们通过预测占用率来验证所提模型的效率和准确性,通过结合实例信息实现 3D 占用全景分割。在 OCC3D-nuScenes 数据集上的实验结果表明,InstanceBEV 仅使用 8 帧即实现了 15.3 的 RayPQ 和 38.2 的 RayIoU。这超越了 SparseOcc 的 RayPQ 9.3% 和 RayIoU 10.7%,展示了多任务协同的有效性。

关键词

引用

@article{arxiv.2505.13817,
  title  = {InstanceBEV: Unifying Instance and BEV Representation for 3D Panoptic Segmentation},
  author = {Feng Li and Zhaoyue Wang and Enyuan Zhang and Mohammad Masum Billah and Yunduan Cui and Kun Xu},
  journal= {arXiv preprint arXiv:2505.13817},
  year   = {2025}
}