用于三维目标检测的体素 Transformer
计算机视觉与模式识别
2021-09-14 v2
摘要
我们提出 Voxel Transformer (VoTr),一种新颖且高效的基于体素的 Transformer 骨干网络,用于从点云中进行三维目标检测。基于体素的三维检测器中的常规三维卷积骨干网络由于感受野有限,无法高效捕获对目标识别与定位至关重要的长程上下文信息。本文中,我们通过引入基于 Transformer 的架构来解决该问题,其借助自注意力实现体素间的长程关联。鉴于非空体素天然稀疏但数量众多,直接在体素上应用标准 Transformer 并非易事。为此,我们提出稀疏体素模块与子流形体素模块,可分别在空与非空体素位置上有效运作。为了在进一步增大注意力范围的同时维持与卷积对应方法相当的计算开销,我们为这两个模块中的多头注意力提出两种注意力机制:局部注意力与空洞注意力,并进一步提出快速体素查询以加速多头注意力中的查询过程。VoTr 包含一系列稀疏与子流形体素模块,可应用于大多数基于体素的检测器。我们提出的 VoTr 在 KITTI 数据集与 Waymo Open 数据集上相较于卷积基线展现出一致的提升,同时保持计算效率。
引用
@article{arxiv.2109.02497,
title = {Voxel Transformer for 3D Object Detection},
author = {Jiageng Mao and Yujing Xue and Minzhe Niu and Haoyue Bai and Jiashi Feng and Xiaodan Liang and Hang Xu and Chunjing Xu},
journal= {arXiv preprint arXiv:2109.02497},
year = {2021}
}
备注
To appear at ICCV 2021