SimC3D:一种基于RGB图像的简单对比式3D预训练框架
计算机视觉与模式识别
2024-12-09 v1
摘要
3D对比学习范式通过在点云数据上进行预训练,在下游任务中展现出显著性能。近期研究通过引入与3D点云相关的2D图像先验进一步提升效果。然而,这些现有框架受限于可用点云数据集的范围,主要由于获取点云数据成本高昂。为此,我们提出SimC3D,一种简单而有效的3D对比学习框架,首次仅使用纯RGB图像数据进行3D backbone的预训练。SimC3D具有三个显著特性:(1)纯图像数据:SimC3D简化了高成本3D点云的依赖,仅使用RGB图像进行3D backbone预训练。通过深度估计和合适的数据处理,单目合成点云在3D预训练方面显示出巨大的潜力。(2)简单框架:传统多模态框架通过引入额外的2D backbone来实现2D先验与3D预训练,从而增加计算开销。本文我们经验性地证明,2D模态的主要优势源于局部信息的融合。灵感来自这一洞见,SimC3D直接采用2D位置嵌入作为更强的对比目标,无需2D backbone,显著提升性能。(3)优异性能:在各种下游任务中,SimC3D均优于使用真实点云数据进行预训练的以往方法。此外,SimC3D通过组合多个图像数据集可进一步提升性能,显示出显著的可扩展性。代码将在https://github.com/Dongjiahua/SimC3D发布。
引用
@article{arxiv.2412.05274,
title = {SimC3D: A Simple Contrastive 3D Pretraining Framework Using RGB Images},
author = {Jiahua Dong and Tong Wu and Rui Qian and Jiaqi Wang},
journal= {arXiv preprint arXiv:2412.05274},
year = {2024}
}