中文

CLIP 走向 3D:利用提示微调实现语言锚定的 3D 识别

计算机视觉与模式识别 2023-04-20 v3

摘要

像 CLIP 这样的视觉-语言模型因其令人印象深刻的零样本能力而被广泛采用用于各种任务。然而,CLIP 不适合提取 3D 几何特征,因为它仅通过自然语言监督在图像和文本上训练。我们致力于解决此限制,并提出称为 CG3D(CLIP Goes 3D)的新框架,其中学习一个 3D 编码器以展现零样本能力。CG3D 使用点云、相应渲染的 2D 图像和文本三元组,通过自然语言监督进行训练。为在多模态嵌入空间中对齐特征,我们对从 3D 编码器获得的 3D 特征以及从 CLIP 提取的视觉和文本特征使用对比损失。我们注意到用于训练 CLIP 的自然图像与 CG3D 中渲染的 2D 图像存在分布偏移。试图训练视觉和文本编码器以考虑此偏移会导致灾难性遗忘和性能显著下降。为解决此问题,我们采用提示微调并在输入空间中引入可训练参数,将 CLIP 偏向 CG3D 中使用的 3D 预训练数据集。我们广泛测试了预训练的 CG3D 框架,并展示了其在零样本、开放场景理解和检索任务中的出色能力。此外,它还可作为下游 3D 识别任务微调的强初始权重。

关键词

引用

@article{arxiv.2303.11313,
  title  = {CLIP goes 3D: Leveraging Prompt Tuning for Language Grounded 3D Recognition},
  author = {Deepti Hegde and Jeya Maria Jose Valanarasu and Vishal M. Patel},
  journal= {arXiv preprint arXiv:2303.11313},
  year   = {2023}
}

备注

Website: https://jeya-maria-jose.github.io/cg3d-web/