中文

SimIPU:面向空间感知视觉表征的简单二维图像与三维点云无监督预训练

计算机视觉与模式识别 2022-01-19 v2

摘要

预训练已成为许多计算机视觉任务中的标准范式。然而,大多数方法通常设计用于RGB图像域。由于二维图像平面与三维空间之间的差异,此类预训练模型无法感知空间信息,并成为三维相关任务的次优解决方案。为弥合这一差距,我们旨在学习一种能够描述三维空间且对这些任务更合适、更有效的空间感知视觉表征。为了利用在提供空间信息方面远优于图像的点云,我们提出了一种简单而有效的二维图像与三维点云无监督预训练策略,称为SimIPU。具体而言,我们开发了一个多模态对比学习框架,该框架分别包含一个用于从点云学习空间感知表征的模态内空间感知模块,以及一个用于将感知空间信息的能力从点云编码器迁移到图像编码器的模态间特征交互模块。对比损失的样本对通过匹配算法和投影矩阵建立。整个框架以无监督的端到端方式进行训练。据我们所知,这是首次探索针对包含配对相机图像和激光雷达点云的室外多模态数据集的对比学习预训练策略的研究。代码和模型可在https://github.com/zhyever/SimIPU获取。

关键词

引用

@article{arxiv.2112.04680,
  title  = {SimIPU: Simple 2D Image and 3D Point Cloud Unsupervised Pre-Training for Spatial-Aware Visual Representations},
  author = {Zhenyu Li and Zehui Chen and Ang Li and Liangji Fang and Qinhong Jiang and Xianming Liu and Junjun Jiang and Bolei Zhou and Hang Zhao},
  journal= {arXiv preprint arXiv:2112.04680},
  year   = {2022}
}

备注

Accepted to 36th AAAI Conference on Artificial Intelligence (AAAI 2022)