中文

MV-CLIP:用于零样本三维形状识别的多视图 CLIP

计算机视觉与模式识别 2024-09-12 v3

摘要

大规模预训练模型在开放世界场景下的视觉与语言任务中已展现出令人印象深刻的性能。由于缺乏可与之比拟的三维形状预训练模型,近期方法利用语言-图像预训练来实现零样本三维形状识别。然而,由于模态鸿沟,预训练的语言-图像模型在泛化到三维形状识别时不够自信。因此,本文旨在通过视图选择与分层提示来提升其置信度。以 CLIP 模型为例,我们在视觉侧通过对三维形状的多个渲染视图识别具有高预测置信度的视图来进行视图选择。在文本侧,首次提出了分层提示策略。第一层以传统类级描述提示若干分类候选,第二层则基于功能级描述或候选间的进一步区分来细化预测。值得注意的是,无需额外训练,我们提出的方法在 ModelNet40、ModelNet10 和 ShapeNet Core55 上分别取得了 84.44%、91.51% 和 66.17% 的令人印象深刻的零样本三维分类准确率。此外,我们将公开代码以促进该领域可复现性与进一步研究。

关键词

引用

@article{arxiv.2311.18402,
  title  = {MV-CLIP: Multi-View CLIP for Zero-shot 3D Shape Recognition},
  author = {Dan Song and Xinwei Fu and Ning Liu and Weizhi Nie and Wenhui Li and Lanjun Wang and You Yang and Anan Liu},
  journal= {arXiv preprint arXiv:2311.18402},
  year   = {2024}
}