TransPillars:用于多帧三维目标检测的由粗到细聚合
计算机视觉与模式识别
2022-08-08 v1
摘要
利用点云的三维目标检测因在自动驾驶与机器人中的广泛应用而日益受到关注。然而,多数现有研究聚焦于单点云帧,未利用点云序列中的时序信息。本文中,我们设计TransPillars,一种新颖的基于Transformer的特征聚合技术,其利用连续点云帧的时序特征进行多帧三维目标检测。TransPillars从两个角度聚合时空点云特征。首先,它直接从多帧特征图融合体素级特征,而非池化后的实例特征,以保留对准确目标定位至关重要的、带上下文信息的实例细节。其次,它引入分层由粗到细策略逐步融合多尺度特征,以有效捕捉运动物体运动并引导细粒度特征聚合。此外,引入一种可变形Transformer变体以提升跨帧特征匹配的有效性。大量实验表明,与现有多帧检测方法相比,我们所提TransPillars取得了最先进的性能。代码将公开。
引用
@article{arxiv.2208.03141,
title = {TransPillars: Coarse-to-Fine Aggregation for Multi-Frame 3D Object Detection},
author = {Zhipeng Luo and Gongjie Zhang and Changqing Zhou and Tianrui Liu and Shijian Lu and Liang Pan},
journal= {arXiv preprint arXiv:2208.03141},
year = {2022}
}