基于 Transformer 的无分组 3D 目标检测
计算机视觉与模式识别
2021-04-26 v2
摘要
近来,直接从 3D 点云检测 3D 目标受到越来越多的关注。为从不规则点云中提取目标表示,现有方法通常采取点分组步骤将 points 分配给目标候选,以便使用类 PointNet 的网络从分组后的点推导目标特征。然而,由手工设计分组方案导致的不准确点分配降低了 3D 目标检测的性能。本文中,我们提出一种简单而有效的方法,用于直接从 3D 点云检测 3D 目标。我们的方法不将局部点分组到每个目标候选,而是借助 Transformers \cite{vaswani2017attention} 中的注意力机制从点云中所有点计算目标特征,其中每个点的贡献在网络训练中自动学习。通过改进的注意力堆叠方案,我们的方法融合不同阶段的目标特征并生成更准确的目标检测结果。在极少额外技巧下,所提方法在两个广泛使用的基准 ScanNet V2 与 SUN RGB-D 上取得了最先进的 3D 目标检测性能。代码与模型公开于 \url{https://github.com/zeliu98/Group-Free-3D}。
引用
@article{arxiv.2104.00678,
title = {Group-Free 3D Object Detection via Transformers},
author = {Ze Liu and Zheng Zhang and Yue Cao and Han Hu and Xin Tong},
journal= {arXiv preprint arXiv:2104.00678},
year = {2021}
}