中文

PVTransformer:用于可扩展 3D 对象检测的点到体 Transformer

计算机视觉与模式识别 2024-05-07 v1

摘要

3D 对象检测器通常依赖基于池化的 PointNet 将稀疏点编码为类网格的体素或柱形结构。本文指出,常见的 PointNet 设计引入了信息瓶颈,限制了 3D 对象检测的准确率和可扩展性。为解决这一限制,我们提出了 PVTransformer:一种基于 Transformer 的点到体架构用于 3D 检测。我们的关键思想是将 PointNet 池化操作替换为注意力模块,从而实现更好的点到体聚合函数。我们的设计尊重稀疏 3D 点的排列不变性,同时比基于池化的 PointNet 更具表达性。实验结果表明,我们的 PVTransformer 在各种 3D 对象检测器中取得了更好的性能。在广泛使用的 Waymo Open Dataset 上,我们的 PVTransformer 实现了 76.5 mAPH L2 的 state-of-the-art 性能,超越了 SWFormer 系列方法提升了 +1.7 mAPH L2。

关键词

引用

@article{arxiv.2405.02811,
  title  = {PVTransformer: Point-to-Voxel Transformer for Scalable 3D Object Detection},
  author = {Zhaoqi Leng and Pei Sun and Tong He and Dragomir Anguelov and Mingxing Tan},
  journal= {arXiv preprint arXiv:2405.02811},
  year   = {2024}
}