PiMAE:用于 3D 目标检测的点云与图像交互式掩码自编码器
计算机视觉与模式识别
2023-03-15 v1 人工智能
摘要
掩码自编码器(Masked Autoencoders)学习强大的视觉表示,并在若干独立模态中取得最先进结果,但极少有工作探讨其在多模态设置中的能力。本文关注点云与 RGB 图像数据——这两种模态在真实世界中常共同出现——并探索其有意义的交互。为改进现有工作中的跨模态协同,我们提出 PiMAE,一种通过三方面促进 3D 与 2D 交互的自监督预训练框架。具体而言,我们首先注意到两种数据源间掩码策略的重要性,并利用投影模块互补对齐两模态的掩码与可见令牌。接着,我们利用精心设计的双分支 MAE 流水线与新奇共享解码器促进掩码令牌中的跨模态交互。最后,我们设计独特的跨模态重建模块以增强两模态的表示学习。通过在大规模 RGB-D 场景理解基准(SUN RGB-D 与 ScannetV2)上进行的广泛实验,我们发现交互式学习点-图像特征并非易事,其中我们将多个 3D 检测器、2D 检测器与少样本分类器分别大幅提升 2.9%、6.7% 与 2.4%。代码见 https://github.com/BLVLab/PiMAE。
引用
@article{arxiv.2303.08129,
title = {PiMAE: Point Cloud and Image Interactive Masked Autoencoders for 3D Object Detection},
author = {Anthony Chen and Kevin Zhang and Renrui Zhang and Zihan Wang and Yuheng Lu and Yandong Guo and Shanghang Zhang},
journal= {arXiv preprint arXiv:2303.08129},
year = {2023}
}
备注
Accepted by CVPR2023. Code is available at https://github.com/BLVLab/PiMAE