面向无监督点云预训练的掩码聚类预测
计算机视觉与模式识别
2025-08-13 v1
摘要
视觉Transformer(ViTs)近期已广泛应用于三维点云理解,其中掩码自编码是主要的预训练范式。然而,通过标准ViTs从点云中学习密集且富含信息的语义特征这一挑战仍未得到充分探索。我们提出MaskClu,一种针对三维点云上ViTs的新型无监督预训练方法,该方法将掩码点建模与基于聚类的学习相结合。MaskClu旨在从掩码点云中重建聚类分配和聚类中心,从而促使模型捕获密集的语义信息。此外,我们引入了一种全局对比学习机制,通过对比同一点云的不同掩码视图来增强实例级特征学习。通过联合优化这些互补目标,即密集语义重建和实例级对比学习,MaskClu使ViTs能够从三维点云中学习到更丰富、语义更丰富的表示。我们通过多个三维任务验证了该方法的有效性,包括部件分割、语义分割、目标检测和分类,在这些任务中MaskClu取得了新的有竞争力的结果。代码和模型将发布于:https://github.com/Amazingren/maskclu。
引用
@article{arxiv.2508.08910,
title = {Masked Clustering Prediction for Unsupervised Point Cloud Pre-training},
author = {Bin Ren and Xiaoshui Huang and Mengyuan Liu and Hong Liu and Fabio Poiesi and Nicu Sebe and Guofeng Mei},
journal= {arXiv preprint arXiv:2508.08910},
year = {2025}
}
备注
3D point cloud pretraining method. 8 pages in the main manuscript