Li3DeTr:一种基于 LiDAR 的 3D 检测 Transformer
计算机视觉与模式识别
2022-10-28 v1 机器学习
摘要
受近期视觉 Transformer 在目标检测中进展的启发,我们提出了 Li3DeTr,一种用于自动驾驶的端到端基于 LiDAR 的 3D 检测 Transformer,其输入为 LiDAR 点云,并回归 3D 边界框。LiDAR 的局部和全局特征分别使用稀疏卷积和多尺度可变形注意力进行编码。在解码器头部,首先,在新颖的 Li3DeTr 交叉注意力块中,我们利用从数据中学习到的稀疏目标查询集,将 LiDAR 全局特征与 3D 预测联系起来。其次,使用多头自注意力来建模目标查询间的交互。最后,解码器层重复 次以细化目标查询。受 DETR 启发,我们采用集到集损失来训练 Li3DeTr 网络。在没有额外技巧的情况下,Li3DeTr 网络在 nuScenes 数据集上达到了 61.3% mAP 和 67.6% NDS,超越了使用非极大值抑制(NMS)的最先进方法,并且在 KITTI 数据集上也取得了有竞争力的性能。我们还采用了知识蒸馏(KD),使用教师和学生模型,略微提升了我们网络的性能。
引用
@article{arxiv.2210.15365,
title = {Li3DeTr: A LiDAR based 3D Detection Transformer},
author = {Gopi Krishna Erabati and Helder Araujo},
journal= {arXiv preprint arXiv:2210.15365},
year = {2022}
}
备注
Accepted at the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2023