中文

CLIP 是细粒度开放世界感知的主要障碍吗?

计算机视觉与模式识别 2024-04-05 v1

摘要

现代应用日益需要能够适应训练期间未遇到的新概念的灵活计算机视觉模型。这种必要性在扩展现实、机器人技术和自动驾驶等新兴领域至关重要,这些领域需要响应开放世界刺激的能力。一个关键要素是能够根据推理时定义的自由形式文本查询来识别物体的能力——这项任务被称为开放词汇目标检测。像 CLIP 这样的多模态主干网络是当前开放世界感知解决方案的主要赋能技术。尽管在通用查询上表现良好,但最近的研究强调了在开放词汇设置下细粒度识别能力的局限性——即,用于区分颜色、形状和材料等微妙物体特征。在本文中,我们对这些开放词汇物体识别的局限性进行了详细检查,以寻找根本原因。我们评估了最常用的视觉-语言主干网络 CLIP 在细粒度物体匹配基准上的性能,揭示了开放词汇目标检测器及其主干网络局限性之间有趣的相似之处。实验表明,缺乏细粒度理解是由于 CLIP 潜在空间中物体特征的可分离性较差。因此,我们试图了解细粒度知识是否存在于 CLIP 嵌入中,但由于例如余弦相似度匹配函数的不适用性而在推理时未被利用,该函数可能会丢弃重要的物体特征。我们的初步实验表明,简单的 CLIP 潜在空间重投影有助于分离细粒度概念,为开发本质上能够处理细粒度细节的主干网络铺平了道路。用于复现这些实验的代码可在 https://github.com/lorebianchi98/FG-CLIP 获取。

关键词

引用

@article{arxiv.2404.03539,
  title  = {Is CLIP the main roadblock for fine-grained open-world perception?},
  author = {Lorenzo Bianchi and Fabio Carrara and Nicola Messina and Fabrizio Falchi},
  journal= {arXiv preprint arXiv:2404.03539},
  year   = {2024}
}