中文

无需标题,不成问题:利用CLIP知识与大语言模型通过难负样本实现无标题3D-CLIP对齐

计算机视觉与模式识别 2024-09-10 v2 人工智能

摘要

在这项研究中,我们探索了一种替代方法,以在缺乏3D对象文本描述的情况下增强对比式文本-图像-3D对齐。我们引入了两种无监督方法,I2II2I(I2L)2(I2L)^2,它们利用CLIP关于文本和2D数据的知识来计算两个3D样本之间的神经感知相似度。我们采用所提出的方法来挖掘3D难负样本,通过自定义损失函数建立具有难负样本加权的多模态对比流水线。我们在所提出的难负样本挖掘方法的不同配置上进行训练,并在3D分类和跨模态检索基准上评估我们模型的准确性,测试图像到形状和形状到图像的检索。结果表明,我们的方法即使没有显式的文本对齐,在零样本和标准3D分类上也达到了相当或更优的性能,同时与先前方法相比,显著改善了图像到形状和形状到图像的检索。

关键词

引用

@article{arxiv.2406.02202,
  title  = {No Captions, No Problem: Captionless 3D-CLIP Alignment with Hard Negatives via CLIP Knowledge and LLMs},
  author = {Cristian Sbrolli and Matteo Matteucci},
  journal= {arXiv preprint arXiv:2406.02202},
  year   = {2024}
}

备注

to be published in BMVC 2024 Proceedings