中文

PVT-SSD:基于点-体素Transformer的单阶段三维目标检测器

计算机视觉与模式识别 2023-05-12 v1

摘要

近期基于Transformer的三维目标检测器从基于点或基于体素的表示中学习点云特征。然而,前者需要耗时的采样,而后者会引入量化误差。本文提出一种用于单阶段三维检测的新型点-体素Transformer(PVT-SSD),兼具这两种表示的优势。具体而言,我们首先使用基于体素的稀疏卷积进行高效特征编码;随后提出点-体素Transformer(PVT)模块,以低成本从体素获取长程上下文,同时从点获得精确位置。关联这两种不同表示的关键在于我们引入的输入依赖查询初始化模块,其可高效生成参考点与内容查询。接着,PVT将参考点周围的长程上下文与局部几何信息自适应融合进内容查询。此外,为快速查找参考点的邻域点,我们设计了虚拟距离图像模块,将原生距离图像推广至多传感器与多帧。在多个自动驾驶基准上的实验验证了所提方法的有效性与高效性。代码将发布于 https://github.com/Nightmare-n/PVT-SSD。

关键词

引用

@article{arxiv.2305.06621,
  title  = {PVT-SSD: Single-Stage 3D Object Detector with Point-Voxel Transformer},
  author = {Honghui Yang and Wenxiao Wang and Minghao Chen and Binbin Lin and Tong He and Hua Chen and Xiaofei He and Wanli Ouyang},
  journal= {arXiv preprint arXiv:2305.06621},
  year   = {2023}
}

备注

CVPR 2023