中文

通过3D到多视角掩码学习器的点云自监督学习

计算机视觉与模式识别 2025-07-29 v2 人工智能

摘要

近来,多模态掩码自编码器(MAE)被引入3D自监督学习,通过利用2D与3D数据捕获更丰富的跨模态表征来增强特征学习。然而,这些方法有两个局限:(1)它们低效地要求以2D与3D模态同时作为输入,尽管3D点云固有的多视角属性已包含2D模态。(2)输入的2D模态使重建学习不必要地依赖可见2D信息,阻碍了3D几何表征学习。为应对这些挑战,我们提出3D到多视角学习器(Multi-View ML),其仅以3D模态作为输入并有效捕获3D点云中丰富的空间信息。具体而言,我们首先基于3D位姿将3D点云在特征级投影至多视角2D图像。然后,我们引入两个组件:(1)一个3D到多视角自编码器,从3D及投影的2D特征重建点云与多视角图像;(2)一个多尺度多头(MSMH)注意力机制,通过不同尺度的注意力头在每个解码器transformer块中促进局部-全局信息交互。此外,提出一种新颖的两阶段自训练策略以对齐2D与3D表征。我们的方法在包括3D分类、部件分割与目标检测在内的多种下游任务上优于最先进的同类方法。

关键词

引用

@article{arxiv.2311.10887,
  title  = {Point Cloud Self-supervised Learning via 3D to Multi-view Masked Learner},
  author = {Zhimin Chen and Xuewei Chen and Xiao Guo and Yingwei Li and Longlong Jing and Liang Yang and Bing Li},
  journal= {arXiv preprint arXiv:2311.10887},
  year   = {2025}
}

备注

Accepted by ICCV 2025