将 CLIP 的知识迁移至零样本点云语义分割
计算机视觉与模式识别
2023-12-13 v1 人工智能
摘要
传统的 3D 分割方法只能识别训练集中出现的固定类别的类别,这由于缺乏泛化能力而限制了其在真实场景中的应用。诸如 CLIP 等大规模视觉-语言预训练模型已在零样本 2D 视觉任务中展现出泛化能力,但仍无法直接应用于 3D 语义分割。在这项工作中,我们聚焦于零样本点云语义分割,并提出了一种简单而有效的基线方法,将 CLIP 中蕴含的视觉-语言知识在特征层面和输出层面迁移至点云编码器。在 2D 和 3D 编码器之间进行特征级和输出级的对齐,以实现有效的知识迁移。具体而言,提出了多粒度跨模态特征对齐(MCFA)模块,从全局语义和局部位置视角对齐 2D 和 3D 特征,以实现特征级对齐。对于输出级,利用预训练的 CLIP 模型提取未见类别的逐像素伪标签,作为 3D 分割模型的监督,以模仿 CLIP 图像编码器的行为。在两个流行的点云分割基准上进行了大量实验。我们的方法在零样本设置下显著优于先前最先进的方法(在 SemanticKITTI 上提升 +29.2% mIoU,在 nuScenes 上提升 31.8% mIoU),并在无标注点云语义分割设置中取得了有希望的结果,展现了其在标签高效学习方面的巨大潜力。
引用
@article{arxiv.2312.07221,
title = {Transferring CLIP's Knowledge into Zero-Shot Point Cloud Semantic Segmentation},
author = {Yuanbin Wang and Shaofei Huang and Yulu Gao and Zhen Wang and Rui Wang and Kehua Sheng and Bo Zhang and Si Liu},
journal= {arXiv preprint arXiv:2312.07221},
year = {2023}
}