体素集Transformer:一种从点云进行三维目标检测的集合到集合方法
计算机视觉与模式识别
2022-03-22 v1
摘要
Transformer已在许多二维视觉任务中展现出有前景的性能。然而,由于点云是一个长序列且在三维空间中分布不均匀,在大尺度点云数据上计算自注意力十分繁琐。为解决此问题,现有方法通常通过将点分组为相同大小的簇来局部计算自注意力,或在离散化表示上执行卷积自注意力。但前者会导致随机的点丢弃,而后者通常具有较窄的注意力范围。本文提出一种新颖的基于体素的架构,即Voxel Set Transformer (VoxSeT),通过集合到集合转换从点云检测三维目标。VoxSeT构建于基于体素的集注意力(VSA)模块之上,该模块通过两个交叉注意力缩减每个体素内的自注意力,并在由一组潜在编码诱导的隐空间中建模特征。借助VSA模块,VoxSeT可管理任意大小的体素化点簇于广域范围内,并以线性复杂度并行处理它们。所提出的VoxSeT将Transformer的高性能与基于体素的模型的高效性相结合,可作为卷积与基于点的骨干网络的良好替代。VoxSeT在KITTI和Waymo检测基准上报告了具有竞争力的结果。源代码见\url{https://github.com/skyhehe123/VoxSeT}。
引用
@article{arxiv.2203.10314,
title = {Voxel Set Transformer: A Set-to-Set Approach to 3D Object Detection from Point Clouds},
author = {Chenhang He and Ruihuang Li and Shuai Li and Lei Zhang},
journal= {arXiv preprint arXiv:2203.10314},
year = {2022}
}
备注
11 pages, 4 figures, CVPR2022