中文

GeoMIM:通过掩码图像建模实现更优三维知识迁移的多视角三维理解

计算机视觉与模式识别 2023-08-29 v2 人工智能

摘要

基于多视角相机的三维检测是计算机视觉中的难题。近期工作借助预训练的 LiDAR 检测模型将知识迁移至基于相机的学生网络。然而,我们认为 LiDAR BEV 特征与基于相机的 BEV 特征之间存在显著的域鸿沟,因其特性不同且来源各异。本文提出几何增强掩码图像建模(GeoMIM),以预训练-微调范式迁移 LiDAR 模型知识,从而提升基于多视角相机的三维检测。GeoMIM 是一种带有跨视角注意力(CVA)块的多相机视觉 Transformer,其使用由预训练 BEV 模型编码的 LiDAR BEV 特征作为学习目标。预训练期间,GeoMIM 的解码器包含一个完成稠密透视视图特征的语义分支,以及另一个重建稠密透视视图深度图的几何分支。深度分支通过输入相机参数以实现相机感知,从而获得更强的迁移能力。大量结果表明,GeoMIM 在 nuScenes 基准上优于现有方法,在基于相机的三维目标检测与三维分割上均取得最先进性能。代码与预训练模型见 https://github.com/Sense-X/GeoMIM。

关键词

引用

@article{arxiv.2303.11325,
  title  = {GeoMIM: Towards Better 3D Knowledge Transfer via Masked Image Modeling for Multi-view 3D Understanding},
  author = {Jihao Liu and Tai Wang and Boxiao Liu and Qihang Zhang and Yu Liu and Hongsheng Li},
  journal= {arXiv preprint arXiv:2303.11325},
  year   = {2023}
}

备注

Release code: https://github.com/Sense-X/GeoMIM