中文

Sonata:可靠点表示的自监督学习

计算机视觉与模式识别 2025-03-21 v1

摘要

本文质疑是否存在一种可靠的自监督点云模型,可通过简单线性探针应用于多种 3D 任务,即使数据有限且计算资源最小化。我们发现,现有的 3D 自监督学习方法在通过线性探针评估表示质量时表现不足。我们假设这是由于我们所称的“几何捷径”所致,导致表示坍缩到低层次空间特征。这一挑战是 3D 独有的,源于点云数据的稀疏性。我们通过两个关键策略来解决:遮蔽空间信息并增强对输入特征的依赖,从而通过自蒸馏构建包含 14 万个点云的 Sonata。Sonata 简单而直观,却获得了强大且可靠的表示:零样本可视化显示语义聚类,并通过最近邻关系实现强大的空间推理。Sonata 在参数和数据效率方面表现卓越:在 ScanNet 上的线性探针准确率从 21.8% 提升至 72.5%,仅用前一种方法数据量的 1% 即可将性能几乎翻倍。完全微调进一步推动了 3D 室内和户外感知任务的 SOTA。

关键词

引用

@article{arxiv.2503.16429,
  title  = {Sonata: Self-Supervised Learning of Reliable Point Representations},
  author = {Xiaoyang Wu and Daniel DeTone and Duncan Frost and Tianwei Shen and Chris Xie and Nan Yang and Jakob Engel and Richard Newcombe and Hengshuang Zhao and Julian Straub},
  journal= {arXiv preprint arXiv:2503.16429},
  year   = {2025}
}

备注

CVPR 2025, produced by Pointcept x Meta, project page: https://xywu.me/sonata/