中文

FrustumFormer:面向多视角三维检测的自适应实例感知重采样

计算机视觉与模式识别 2023-03-27 v2

摘要

将特征从二维透视空间转换到三维空间对于多视角三维目标检测至关重要。近期方法主要关注视图变换的设计,要么通过估计深度将透视视图特征逐像素地提升到三维空间,要么通过三维投影逐网格地构建BEV特征,平等对待所有像素或网格。然而,选择转换什么内容同样重要,但此前鲜有讨论。行驶中汽车像素的信息量要高于天空像素。为充分利用图像所含信息,视图变换应能根据图像区域内容自适应调整。本文提出一种名为FrustumFormer的新框架,通过自适应实例感知重采样更关注实例区域特征。具体而言,模型利用图像视图目标提议在鸟瞰图上获取实例视锥。在实例视锥内学习自适应占据掩码以细化实例位置。此外,时序视锥交集可进一步降低目标定位不确定性。在nuScenes数据集上的综合实验证明了FrustumFormer的有效性,我们在该基准上取得了新的SOTA性能。代码与模型将发布于 https://github.com/Robertwyq/Frustum。

关键词

引用

@article{arxiv.2301.04467,
  title  = {FrustumFormer: Adaptive Instance-aware Resampling for Multi-view 3D Detection},
  author = {Yuqi Wang and Yuntao Chen and Zhaoxiang Zhang},
  journal= {arXiv preprint arXiv:2301.04467},
  year   = {2023}
}

备注

Accepted to CVPR 2023