中文

DiffBEV:用于鸟瞰图感知的条件扩散模型

计算机视觉与模式识别 2023-03-16 v1

摘要

BEV感知在自动驾驶领域至关重要,是规划、控制与运动预测的基石。BEV特征的质量极大影响BEV感知的性能。然而,考虑到相机参数与LiDAR扫描中的噪声,我们通常获得带有有害噪声的BEV表示。扩散模型天然具备将含噪样本去噪至理想数据的能力,这促使我们利用扩散模型获得更好的BEV表示。本工作中,我们提出一个端到端框架DiffBEV,以挖掘扩散模型生成更完备BEV表示的潜力。据我们所知,我们首次将扩散模型应用于BEV感知。实践中,我们设计三类条件来引导扩散模型的训练,以渐进方式对粗采样去噪并精炼语义特征。此外,利用交叉注意力模块融合BEV特征的上下文与条件扩散模型的语义内容。DiffBEV在nuScenes数据集上取得25.9%的mIoU,比现有最优方法高6.2%。多个基准上的定量与定性结果表明DiffBEV在BEV语义分割与3D目标检测任务中的有效性。代码将很快公开。

关键词

引用

@article{arxiv.2303.08333,
  title  = {DiffBEV: Conditional Diffusion Model for Bird's Eye View Perception},
  author = {Jiayu Zou and Zheng Zhu and Yun Ye and Xingang Wang},
  journal= {arXiv preprint arXiv:2303.08333},
  year   = {2023}
}