GeoMIM:通过掩码图像建模实现更优三维知识迁移的多视角三维理解
计算机视觉与模式识别
2023-08-29 v2 人工智能
摘要
基于多视角相机的三维检测是计算机视觉中的难题。近期工作借助预训练的 LiDAR 检测模型将知识迁移至基于相机的学生网络。然而,我们认为 LiDAR BEV 特征与基于相机的 BEV 特征之间存在显著的域鸿沟,因其特性不同且来源各异。本文提出几何增强掩码图像建模(GeoMIM),以预训练-微调范式迁移 LiDAR 模型知识,从而提升基于多视角相机的三维检测。GeoMIM 是一种带有跨视角注意力(CVA)块的多相机视觉 Transformer,其使用由预训练 BEV 模型编码的 LiDAR BEV 特征作为学习目标。预训练期间,GeoMIM 的解码器包含一个完成稠密透视视图特征的语义分支,以及另一个重建稠密透视视图深度图的几何分支。深度分支通过输入相机参数以实现相机感知,从而获得更强的迁移能力。大量结果表明,GeoMIM 在 nuScenes 基准上优于现有方法,在基于相机的三维目标检测与三维分割上均取得最先进性能。代码与预训练模型见 https://github.com/Sense-X/GeoMIM。
引用
@article{arxiv.2303.11325,
title = {GeoMIM: Towards Better 3D Knowledge Transfer via Masked Image Modeling for Multi-view 3D Understanding},
author = {Jihao Liu and Tai Wang and Boxiao Liu and Qihang Zhang and Yu Liu and Hongsheng Li},
journal= {arXiv preprint arXiv:2303.11325},
year = {2023}
}
备注
Release code: https://github.com/Sense-X/GeoMIM