P3P:用于扩展基于体素的掩码自编码器的伪3D预训练
计算机视觉与模式识别
2025-05-22 v3
摘要
3D预训练对3D感知任务至关重要。然而,由于收集干净完整3D数据的困难,3D预训练一直面临数据扩展的挑战。在这项工作中,我们引入了一种新颖的自监督预训练框架,通过利用一个大型深度估计模型,将数百万张图像纳入3D预训练语料库。新的预训练语料库给模型的表示能力和嵌入效率带来了新挑战。之前的预训练方法依赖最远点采样和k近邻来嵌入固定数量的3D标记。然而,当需要嵌入具有不同点数范围(从1,000到100,000)的数百万个样本时,这些方法被证明是不足的。相比之下,我们提出了一种具有线性时间复杂度的标记器,能够高效嵌入可变数量的标记。因此,提出了一种新的3D重建目标与我们的3D标记器配合使用。我们的方法在3D分类、少样本学习和3D分割方面达到了最先进性能。代码可在https://github.com/XuechaoChen/P3P-MAE获取。
引用
@article{arxiv.2408.10007,
title = {P3P: Pseudo-3D Pre-training for Scaling 3D Voxel-based Masked Autoencoders},
author = {Xuechao Chen and Ying Chen and Jialin Li and Qiang Nie and Hanqiu Deng and Yong Liu and Qixing Huang and Yang Li},
journal= {arXiv preprint arXiv:2408.10007},
year = {2025}
}
备注
Under review. Pre-print