基于掩码形状预测的自监督预训练用于 3D 场景理解
计算机视觉与模式识别
2023-05-10 v1
摘要
掩码信号建模已极大推进了语言与 2D 图像的自监督预训练。然而,在 3D 场景理解中仍未被充分探索。因此,本文引入掩码形状预测(MSP),一种在 3D 场景中执行掩码信号建模的新框架。MSP 使用本质的 3D 语义线索,即几何形状,作为被掩码点的预测目标。提出由显式形状上下文与隐式深度形状特征构成的上下文增强形状目标,以促进在形状预测中利用上下文线索。同时,MSP 中的预训练架构经过精心设计,以缓解来自点坐标的掩码形状泄漏。在室内与室外数据集上多个 3D 理解任务的实验证明了 MSP 在学习良好特征表示以持续提升下游性能方面的有效性。
引用
@article{arxiv.2305.05026,
title = {Self-supervised Pre-training with Masked Shape Prediction for 3D Scene Understanding},
author = {Li Jiang and Zetong Yang and Shaoshuai Shi and Vladislav Golyanik and Dengxin Dai and Bernt Schiele},
journal= {arXiv preprint arXiv:2305.05026},
year = {2023}
}
备注
CVPR 2023