PointCLIP:基于 CLIP 的点云理解
计算机视觉与模式识别
2021-12-07 v1 人工智能
机器人学
摘要
近年来,通过对比视觉-语言预训练(CLIP)进行的零样本和少样本学习在 2D 视觉识别上展现了令人鼓舞的性能,其学习在开放词汇设置下将图像与对应文本进行匹配。然而,在 2D 大规模图像-文本对上预训练的 CLIP 是否能够推广到 3D 识别,仍未被充分探索。在本文中,我们提出 PointCLIP,通过对 CLIP 编码的点云与 3D 类别文本进行对齐,证实了这一设置是可行的。具体而言,我们将点云投影为多视角深度图(无需渲染)来进行编码,并聚合视角级的零样本预测以实现从 2D 到 3D 的知识迁移。在此基础上,我们设计了一个视角间适配器,以更好地提取全局特征,并将从 3D 学到的少样本知识自适应地融合进在 2D 预训练的 CLIP 中。通过在少样本设置下仅微调轻量适配器,PointCLIP 的性能便可大幅提升。此外,我们观察到 PointCLIP 与经典 3D 监督网络之间的互补特性。通过简单集成,PointCLIP 提升了基线的性能,甚至超越了最先进的模型。因此,PointCLIP 是一种在低成本和数据条件下通过 CLIP 实现有效 3D 点云理解的有前景的替代方案。我们在广泛采用的 ModelNet10、ModelNet40 以及具有挑战性的 ScanObjectNN 上进行了充分实验,以证明 PointCLIP 的有效性。代码发布于 https://github.com/ZrrSkywalker/PointCLIP。
引用
@article{arxiv.2112.02413,
title = {PointCLIP: Point Cloud Understanding by CLIP},
author = {Renrui Zhang and Ziyu Guo and Wei Zhang and Kunchang Li and Xupeng Miao and Bin Cui and Yu Qiao and Peng Gao and Hongsheng Li},
journal= {arXiv preprint arXiv:2112.02413},
year = {2021}
}
备注
Open sourced, Code and Model Available