中文

基于 CLIP 的点云到图像翻译点云分类

计算机视觉与模式识别 2024-08-08 v1

摘要

点云理解是因点云在 3D 空间中的稀疏和无序结构而具有内在挑战的。最近,基于对比式视觉语言预训练(CLIP)的点云分类模型即 PointCLIP 已为点云分类研究领域带来新方向。该方法首先从点云中提取多视角深度图,并通过 CLIP 视觉编码器处理。为将 3D 知识传递给网络,需在 CLIP 视觉编码器上微调称为适配器的小型网络。PointCLIP 有两个局限:其一,点云深度图缺乏分类和识别等任务所必需的图像信息;其二,适配器仅依赖多视角特征的全局表示。为此,我们提出了 Pretrained Point Cloud to Image Translation Network(PPCITNet),该网络为点云深度图生成通用彩色图像并提供额外显著视觉线索,以实现点云分类和理解的优异性能。此外,我们提出了新颖的视角适配器,将每个视角处理的特征与跨多视角特征中存在的全局交织知识相结合。实验结果表明,该模型在 ModelNet10、ModelNet40 和 ScanobjectNN 数据集上超越了现有最先进的 CLIP-based 模型。

关键词

引用

@article{arxiv.2408.03545,
  title  = {CLIP-based Point Cloud Classification via Point Cloud to Image Translation},
  author = {Shuvozit Ghose and Manyi Li and Yiming Qian and Yang Wang},
  journal= {arXiv preprint arXiv:2408.03545},
  year   = {2024}
}

备注

Accepted by ICPR2024