中文

CALICO:面向 BEV 感知的自监督相机-激光雷达对比预训练

计算机视觉与模式识别 2023-11-28 v2 机器学习

摘要

感知在自动驾驶系统领域中至关重要,基于鸟瞰图(bird's eye view, BEV)的架构近期已达到最先进的性能。自监督表示学习的价值源于标注 2D 和 3D 数据这一过程昂贵且费力。尽管先前研究已探讨针对激光雷达与基于相机的 3D 目标检测的预训练方法,但面向多模态 BEV 感知的统一预训练框架尚属空白。本研究提出 CALICO,一种将对比目标应用于激光雷达与相机骨干网络的新颖框架。具体而言,CALICO 包含两阶段:点-区域对比(point-region contrast, PRC)与区域感知蒸馏(region-aware distillation, RAD)。PRC 更好地平衡了激光雷达模态上区域级与场景级表示学习,相较现有方法带来显著性能提升。RAD 在我们自训练的教师模型上有效实现了对比蒸馏。CALICO 的有效性通过 3D 目标检测与 BEV 地图分割任务的广泛评估得到证实,其带来了显著的性能改进。值得注意的是,CALICO 在 NDS 与 mAP 上分别超越基线方法 10.5% 与 8.6%。此外,CALICO 提升了多模态 3D 目标检测对抗攻击与腐蚀的鲁棒性。再者,我们的框架可适配不同骨干网络与检测头,使其成为多模态 BEV 感知的一种有前景的方法。

关键词

引用

@article{arxiv.2306.00349,
  title  = {CALICO: Self-Supervised Camera-LiDAR Contrastive Pre-training for BEV Perception},
  author = {Jiachen Sun and Haizhong Zheng and Qingzhao Zhang and Atul Prakash and Z. Morley Mao and Chaowei Xiao},
  journal= {arXiv preprint arXiv:2306.00349},
  year   = {2023}
}