利用通道式 Transformer 改进三维目标检测
计算机视觉与模式识别
2021-09-16 v2
摘要
尽管基于点云的三维目标检测近年来取得了快速进展,但灵活且高性能的候选框精修的缺失仍是现有最优两阶段检测器的一大障碍。先前精修三维候选框的工作依赖于人工设计的组件,如关键点采样、集合抽象和多尺度特征融合,以产生强大的三维目标表示。然而,此类方法在捕获点之间丰富上下文依赖关系方面的能力有限。本文中,我们利用高质量区域候选网络与通道式 Transformer 架构,以极少的手工设计构成我们的两阶段三维目标检测框架(CT3D)。所提出的 CT3D 同时执行候选框感知嵌入与每个候选框内点特征的通道式上下文聚合。具体而言,CT3D 利用候选框的关键点进行空间上下文建模,并在编码模块中学习注意力传播,将候选框映射到点嵌入。接着,一个新的通道式解码模块通过通道式重加权丰富查询-键交互,以有效合并多级上下文,这有助于更精确的目标预测。大量实验表明,我们的 CT3D 方法具有优越性能与出色的可扩展性。值得注意的是,CT3D 在 KITTI 测试三维检测基准的中等难度车辆类别上实现了 81.77% 的 AP,优于最优三维检测器。
引用
@article{arxiv.2108.10723,
title = {Improving 3D Object Detection with Channel-wise Transformer},
author = {Hualian Sheng and Sijia Cai and Yuan Liu and Bing Deng and Jianqiang Huang and Xian-Sheng Hua and Min-Jian Zhao},
journal= {arXiv preprint arXiv:2108.10723},
year = {2021}
}
备注
Accepted by ICCV2021