中文

掩码场景对比:一种可扩展的无监督 3D 表示学习框架

计算机视觉与模式识别 2023-03-27 v1

摘要

作为开创性工作,PointContrast 通过对原始 RGB-D 帧施加对比学习来进行无监督 3D 表示学习,并证明了其在多种下游任务上的有效性。然而,由于两个绊脚石——将 RGB-D 帧匹配为对比视图的低效性,以及先前工作中提及的恼人模式坍塌现象——3D 大规模无监督学习的趋势尚待兴起。我们将这两个绊脚石转化为经验基石:首先提出一种高效且有效的对比学习框架,其通过精心策划的数据增强流水线与实用的视图混合策略,直接在场景级点云上生成对比视图;其次,我们在该对比学习框架上引入重构学习,并精巧地设计对比交叉掩码,以点颜色与 surfel 法向的重建为目标。我们的掩码场景对比(Masked Scene Contrast, MSC)框架能够更高效且有效地提取全面的 3D 表示。它使预训练过程加速至少 3 倍,且与先前工作相比性能毫不逊色。此外,MSC 还支持跨多个数据集的大规模 3D 预训练,这进一步提升了性能,并在若干下游任务上取得最先进的微调结果,例如在 ScanNet 语义分割验证集上达到 75.5% mIoU。

关键词

引用

@article{arxiv.2303.14191,
  title  = {Masked Scene Contrast: A Scalable Framework for Unsupervised 3D Representation Learning},
  author = {Xiaoyang Wu and Xin Wen and Xihui Liu and Hengshuang Zhao},
  journal= {arXiv preprint arXiv:2303.14191},
  year   = {2023}
}

备注

Accepted by CVPR 2023, available at https://github.com/Pointcept/Pointcept