OcTr:基于八叉树的Transformer三维目标检测
计算机视觉与模式识别
2023-03-23 v1
摘要
基于LiDAR的三维目标检测的一个关键挑战是从大规模三维场景中捕获充足的特征,尤其是对于远处和/或被遮挡的物体。尽管近期Transformer凭借长序列建模能力做出了努力,但它们未能恰当平衡精度与效率,受限于不充分的感受野或粗粒度的整体关联。本文中,我们提出一种基于八叉树的Transformer,名为OcTr,以解决该问题。它首先通过在顶层执行自注意力在层次化特征金字塔上构建动态八叉树,随后在八分体限制下递归传播至下层,从而以由粗到细的方式捕获丰富的全局上下文,同时将计算复杂度控制在合理范围。此外,为增强前景感知,我们提出一种混合位置嵌入,由语义感知位置嵌入与注意力掩码组成,以充分利用语义与几何线索。在Waymo Open Dataset与KITTI Dataset上进行了充分实验,OcTr达到了新的SOTA结果。
引用
@article{arxiv.2303.12621,
title = {OcTr: Octree-based Transformer for 3D Object Detection},
author = {Chao Zhou and Yanan Zhang and Jiaxin Chen and Di Huang},
journal= {arXiv preprint arXiv:2303.12621},
year = {2023}
}
备注
Accepted by CVPR 2023