中文

CLIP$^2$:基于真实世界点云数据的对比语言-图像-点云预训练

计算机视觉与模式识别 2023-03-28 v2

摘要

对比语言-图像预训练(CLIP)受益于大规模无标签文本-图像对,在开放世界视觉理解任务中展现了优异性能。然而,由于有限的文本-3D数据对,将2D视觉-语言模型(VLM)的成功推广至3D空间仍是一个开放问题。现有利用VLM进行3D理解的工作通常求助于为3D数据构建中间2D表示,但代价是丢失3D几何信息。为迈向开放世界3D视觉理解,我们提出对比语言-图像-点云预训练(CLIP2^2),通过一种新颖的代理对齐机制,直接在真实场景中学习可迁移的3D点云表示。具体而言,我们利用2D与3D场景中自然存在的对应关系,并从这些复杂场景中构建对齐良好且基于实例的文本-图像-点代理。在此基础上,我们提出一种跨模态对比目标,以学习语义与实例级对齐的点云表示。在室内与室外场景上的实验结果表明,我们所学的3D表示在下游任务(包括零样本与少样本3D识别)中具有强大的迁移能力,大幅提升了当前最优方法的性能。此外,我们分析了不同表示在真实场景中的能力,并给出了可选的集成方案。

关键词

引用

@article{arxiv.2303.12417,
  title  = {CLIP$^2$: Contrastive Language-Image-Point Pretraining from Real-World Point Cloud Data},
  author = {Yihan Zeng and Chenhan Jiang and Jiageng Mao and Jianhua Han and Chaoqiang Ye and Qingqiu Huang and Dit-Yan Yeung and Zhen Yang and Xiaodan Liang and Hang Xu},
  journal= {arXiv preprint arXiv:2303.12417},
  year   = {2023}
}

备注

To appear at CVPR 2023