CLIP2Point:通过图像-深度预训练将 CLIP 迁移至点云分类
计算机视觉与模式识别
2023-08-24 v3
摘要
由于训练数据有限,3D 视觉与语言间的预训练仍待发展。近期工作尝试将视觉-语言预训练模型迁移至 3D 视觉。PointCLIP 将点云数据转换为多视角深度图,采用 CLIP 进行形状分类。然而,其性能受限于渲染深度图与图像间的域差距以及深度分布的多样性。为解决此问题,我们提出 CLIP2Point,一种通过对比学习将 CLIP 迁移至 3D 域的图像-深度预训练方法,并适配于点云分类。我们引入一种形成更佳视觉效果的深度渲染设置,并从 ShapeNet 渲染 52,460 对图像与深度图用于预训练。CLIP2Point 的预训练方案结合跨模态学习以强制深度特征捕获具表现力的视觉与文本特征,以及模内学习以增强深度聚合的不变性。此外,我们提出一种新颖的双路径适配器(DPA)模块,即一种带简化适配器的双路径结构,用于少样本学习。双路径结构允许联合使用 CLIP 与 CLIP2Point,且简化适配器无需后搜索即可良好拟合少样本任务。实验结果表明 CLIP2Point 在将 CLIP 知识迁移至 3D 视觉方面有效。我们的 CLIP2Point 优于 PointCLIP 及其他自监督 3D 网络,在零样本与少样本分类上取得最先进结果。
引用
@article{arxiv.2210.01055,
title = {CLIP2Point: Transfer CLIP to Point Cloud Classification with Image-Depth Pre-training},
author = {Tianyu Huang and Bowen Dong and Yunhan Yang and Xiaoshui Huang and Rynson W. H. Lau and Wanli Ouyang and Wangmeng Zuo},
journal= {arXiv preprint arXiv:2210.01055},
year = {2023}
}
备注
Accepted by ICCV2023