中文

面向3D场景理解的基础模型: 基于点云的实例感知自监督学习

计算机视觉与模式识别 2026-04-01 v2

摘要

近期自监督学习 (SSL) 在点云上的进展显著提升了无需人工标注的3D场景理解能力。现有方法强调语义感知,通过在增强视图之间强制特征一致性或通过掩码场景建模来实现。然而,所得表征对实例局部化的迁移效果不佳,常需完整微调才能获得强性能。实例感知是3D感知的基本组成部分,因此弥合这一差距对于推进向真正意义上的3D基础模型发展至关重要,这些模型支持3D数据上的所有下游任务。本文引入 PointINS,一种以实例为导向的自监督框架,通过几何感知学习丰富点云表征。PointINS 使用正交偏移分支联合学习高层语义理解和几何推理,实现实例感知。我们识别了实现稳健实例局部化所必需的两个一致属性,并将其形式化为互补的正则化策略:偏移分布正则化 (ODR),用于将预测偏移与经观察到的几何先验对齐;空间聚类正则化 (SCR),用于通过正则化偏移与伪实例掩码来实现局部一致性。通过在五个数据集上的大量实验,PointINS 在室内实例分割上平均提高 3.5% 的 mAP,在户外全景分割上平均提高 4.1% 的 PQ,为可扩展的3D基础模型之路。

关键词

引用

@article{arxiv.2603.25165,
  title  = {Towards Foundation Models for 3D Scene Understanding: Instance-Aware Self-Supervised Learning for Point Clouds},
  author = {Bin Yang and Mohamed Abdelsamad and Miao Zhang and Alexandru Paul Condurache},
  journal= {arXiv preprint arXiv:2603.25165},
  year   = {2026}
}

备注

The paper was accepted by CVPR2026