中文

DiffCLIP:利用稳定扩散实现语言锚定的三维分类

计算机视觉与模式识别 2024-05-07 v3

摘要

大型预训练模型通过实现多模态学习对计算机视觉产生了重大影响,其中 CLIP 模型在图像分类、目标检测和语义分割中取得了令人印象深刻的成果。然而,由于 CLIP 的 3D 投影深度图与训练图像之间存在域差距,该模型在 3D 点云处理任务上的性能受限。本文提出 DiffCLIP,一种结合稳定扩散与 ControlNet 以缩小视觉分支域差距的新型预训练框架。此外,在文本分支中引入了用于少样本任务的风格提示生成模块。在 ModelNet10、ModelNet40 和 ScanObjectNN 数据集上的大量实验表明,DiffCLIP 具备强大的 3D 理解能力。通过利用稳定扩散和风格提示生成,DiffCLIP 在 ScanObjectNN 的 OBJ_BG 上取得了 43.2% 的零样本分类准确率(当前最优性能),在 ModelNet10 上取得了 80.6% 的零样本分类准确率(与当前最优性能相当)。

关键词

引用

@article{arxiv.2305.15957,
  title  = {DiffCLIP: Leveraging Stable Diffusion for Language Grounded 3D Classification},
  author = {Sitian Shen and Zilin Zhu and Linqian Fan and Harry Zhang and Xinxiao Wu},
  journal= {arXiv preprint arXiv:2305.15957},
  year   = {2024}
}