中文

CLAP: 通过曲率采样和原型学习实现融合3D感知的无监督3D表示学习

计算机视觉与模式识别 2026-03-02 v3

摘要

无监督3D表示学习减轻了为融合感知任务标注多模态3D数据的负担。在不同的预训练范式中,基于可微渲染的方法显示出最大的前景。然而,由于处理包含图像的大规模点云的计算成本,现有工作对每种模态分别进行预训练。因此,高层语义(来自图像)和3D结构(来自点云)的互惠互利尚未得到利用。为弥补这一空白,我们提出了一种针对图像和点云的联合无监督可微渲染预训练方法,称为CLAP,即曲率采样和可学习原型(Curvature sampLing and leArnable Prototype)的缩写。具体而言,我们的方法通过曲率采样选择信息更丰富的点/像素进行预训练,从而克服了计算障碍。为了揭示它们互补性带来的性能优势,我们提出使用可学习原型在共同特征空间中表示3D场景的部分,并采用期望最大化训练方案将每种模态的嵌入与原型关联起来。我们进一步提出了一种交换预测损失,通过原型探索它们之间的相互作用,并辅以Gram矩阵正则化项以保持训练稳定性。在NuScenes和Waymo数据集上的实验表明,与之前最先进的预训练方法相比,CLAP的性能提升高达100%。

关键词

引用

@article{arxiv.2412.03059,
  title  = {CLAP: Unsupervised 3D Representation Learning for Fusion 3D Perception via Curvature Sampling and Prototype Learning},
  author = {Runjian Chen and Hang Zhang and Avinash Ravichandran and Hyoungseob Park and Wenqi Shao and Alex Wong and Ping Luo},
  journal= {arXiv preprint arXiv:2412.03059},
  year   = {2026}
}