中文

分而治之:利用二维语义-深度先验与输入依赖查询提升多相机3D感知

计算机视觉与模式识别 2024-08-14 v1

摘要

多相机图像的三维感知任务,如三维目标检测和鸟瞰图(BEV)分割,近年来引起了广泛关注。尽管准确估计语义和三维场景布局对此任务至关重要,但现有技术往往忽略语义和深度线索的协同效应,导致分类和位置估计错误。此外,初始查询的输入无关特性也限制了基于Transformer模型的学习能力。为应对这些挑战,我们提出了一个输入感知的Transformer框架,将语义和深度作为先验(命名为SDTR)。我们的方法包括一个S-D编码器,显式建模语义和深度先验,从而将目标分类和位置估计的学习过程解耦。此外,我们引入了一个先验引导查询构建器,将语义先验融入Transformer的初始查询中,从而生成更有效的输入感知查询。在nuScenes和Lyft基准数据集上的大量实验证明了我们的方法在三维目标检测和BEV分割任务中的最先进性能。

关键词

引用

@article{arxiv.2408.06901,
  title  = {Divide and Conquer: Improving Multi-Camera 3D Perception with 2D Semantic-Depth Priors and Input-Dependent Queries},
  author = {Qi Song and Qingyong Hu and Chi Zhang and Yongquan Chen and Rui Huang},
  journal= {arXiv preprint arXiv:2408.06901},
  year   = {2024}
}

备注

Accepted by TIP 2024