中文

FSF-Net:基于粗糙 BEV 场景流增强自动驾驶的 4D 占用预测

计算机视觉与模式识别 2024-09-25 v1

摘要

4D 占用预测是自动驾驶的重要技术之一,可避免复杂交通场景中的潜在风险。场景流是描述 4D 占用图趋势的关键因素。然而,在实际场景中很难预测准确的场景流。本文发现,BEV 场景流可大致代表大多数交通场景中的 3D 场景流,且粗糙 BEV 场景流较易生成。基于此思想,我们提出了基于粗糙 BEV 场景流的 4D 占用预测方法 FSF-Net。首先,我们基于粗糙 BEV 场景流开发了通用占用预测架构。随后,为进一步增强 4D 占用特征表示能力,我们提出了基于向量量化的 Mamba 网络(VQ-Mamba)以挖掘时空结构场景特征。最后,为有效融合来自 BEV 场景流和潜在特征的粗糙占用图预测结果,我们设计了基于 U-Net 的质量融合(UQF)网络以生成细粒度预测结果。在公开的 Occ3D 数据集上进行了大量实验。FSF-Net 在 IoU 和 mIoU 上分别比最先进的方法高出 9.56% 和 10.87%。因此,我们认为提出的 FSF-Net 有助于提高自动驾驶的安全性。

关键词

引用

@article{arxiv.2409.15841,
  title  = {FSF-Net: Enhance 4D Occupancy Forecasting with Coarse BEV Scene Flow for Autonomous Driving},
  author = {Erxin Guo and Pei An and You Yang and Qiong Liu and An-An Liu},
  journal= {arXiv preprint arXiv:2409.15841},
  year   = {2024}
}