中文

GeneCIS:通用条件图像相似性基准

计算机视觉与模式识别 2023-06-14 v1 人工智能 机器学习 多媒体

摘要

我们认为“相似性”存在多种概念,模型应像人类一样能够动态适应这些概念。这与大多数表征学习方法(监督或自监督)形成对比,后者学习固定的嵌入函数,从而隐式假设单一的相似性概念。例如,在ImageNet上训练的模型偏向于物体类别,而用户可能更希望模型关注颜色、纹理或场景中的特定元素。本文中,我们提出GeneCIS('genesis')基准,用于衡量模型适应一系列相似性条件的能力。在先前工作基础上,我们的基准仅面向零样本评估,因此考虑开放集的相似性条件。我们发现强大CLIP模型的基线在GeneCIS上表现不佳,且基准上的性能与ImageNet精度仅弱相关,表明简单扩展现有方法并无成效。我们进一步提出一种基于从现有图像-描述数据集中自动挖掘信息的简单、可扩展方案。我们发现该方法在GeneCIS上较基线有大幅提升,并进一步改善了在相关图像检索基准上的零样本性能。事实上,尽管以零样本评估,我们的模型在MIT-States上超越了最先进的监督模型。项目主页:https://sgvaze.github.io/genecis/。

关键词

引用

@article{arxiv.2306.07969,
  title  = {GeneCIS: A Benchmark for General Conditional Image Similarity},
  author = {Sagar Vaze and Nicolas Carion and Ishan Misra},
  journal= {arXiv preprint arXiv:2306.07969},
  year   = {2023}
}

备注

CVPR 2023 (Highlighted Paper). Project page at https://sgvaze.github.io/genecis/