掩码场景建模:缩小监督学习与自监督学习在3D场景理解之间的差距
计算机视觉与模式识别
2025-04-10 v1 人工智能
摘要
自监督学习已通过使模型在大型无标注数据集上训练而提供类似于在标签数据上训练的模型的通用功能而在2D计算机视觉中取得变革。然而,在3D场景理解中,自监督方法通常仅用作特定任务微调的权重初始化步骤,限制了其在通用特征提取方面的实用性。本文通过提出一种专为评估3D场景理解自监督特征质量而设计的稳健评估协议来解决这一不足。我们的协议使用层次模型的多分辨率特征抽取,以创建捕捉模型语义能力的丰富点级表示,因而适合用于线性探测和最近邻方法。此外,我们引入了首个在仅使用离屏特征时,能够在线性探测设置下表现类似于监督模型的自监督模型。特别是,我们的模型以面向层次3D模型的全新自监督方法进行训练,基于掩码场景建模目标,对被遮盖区域的深度特征进行自下而上方式的重建,专为此类模型而设计。我们的实验不仅表明该方法在准确度上与监督模型相当,而且在已有自监督方法上取得显著优势。该模型和训练代码可在我们的GitHub存储库中找到(https://github.com/phermosilla/msm)。
引用
@article{arxiv.2504.06719,
title = {Masked Scene Modeling: Narrowing the Gap Between Supervised and Self-Supervised Learning in 3D Scene Understanding},
author = {Pedro Hermosilla and Christian Stippel and Leon Sick},
journal= {arXiv preprint arXiv:2504.06719},
year = {2025}
}
备注
Accepted at CVPR 2025