中文

AutoAlign:面向多模态三维目标检测的像素-实例特征聚合

计算机视觉与模式识别 2022-04-22 v2

摘要

通过 RGB 图像或 LiDAR 点云进行目标检测在自动驾驶中已被广泛研究。然而,使这两种数据源相互补充并彼此受益仍然具有挑战性。本文提出 AutoAlign,一种用于三维目标检测的自动特征融合策略。我们不再利用相机投影矩阵建立确定性对应关系,而是用可学习的对齐图来建模图像与点云之间的映射关系。该图使我们的模型能够以动态且数据驱动的方式自动对齐非同质特征。具体而言,设计了一个交叉注意力特征对齐模块,为每个体素自适应地聚合像素级图像特征。为增强特征对齐过程中的语义一致性,我们还设计了一个自监督跨模态特征交互模块,模型通过该模块可在实例级特征引导下学习特征聚合。大量实验结果表明,我们的方法在 KITTI 和 nuScenes 数据集上分别带来了 2.3 mAP 和 7.0 mAP 的提升。值得注意的是,我们的最佳模型在 nuScenes 测试排行榜上达到 70.9 NDS,在各种最先进方法中取得了具有竞争力的性能。

关键词

引用

@article{arxiv.2201.06493,
  title  = {AutoAlign: Pixel-Instance Feature Aggregation for Multi-Modal 3D Object Detection},
  author = {Zehui Chen and Zhenyu Li and Shiquan Zhang and Liangji Fang and Qinghong Jiang and Feng Zhao and Bolei Zhou and Hang Zhao},
  journal= {arXiv preprint arXiv:2201.06493},
  year   = {2022}
}

备注

Accepted to IJCAI2022