中文

InDiReCT:面向图像的语言引导零样本深度度量学习

计算机视觉与模式识别 2022-11-24 v1 人工智能 信息检索

摘要

常见的深度度量学习(DML)数据集仅指定一种相似性概念,例如,Cars196 数据集中两幅图像若展示同一车型则被视为相似。我们认为,依据应用不同,图像检索系统的用户具有不同且变化的相似性概念,应尽可能地易于纳入。因此,我们提出语言引导零样本深度度量学习(LanZ-DML)作为一种新的 DML 设定,其中用户无需训练数据,仅通过自然语言即可控制对图像表示重要的属性。为此,我们提出 InDiReCT(基于 CLIP 嵌入文本降维的图像表示),一种用于图像 LanZ-DML 的模型,其仅使用少量文本提示进行训练。InDiReCT 利用 CLIP 作为图像与文本的固定特征提取器,并将文本提示嵌入中的变化迁移至图像嵌入空间。在五个数据集及共十三种相似性概念上的大量实验表明,尽管训练时未见到任何图像,InDiReCT 仍优于强基线并接近全监督模型的性能。一项分析揭示,InDiReCT 学会聚焦于与期望相似性概念相关的图像区域,这使其成为一种训练快速、易用且仅用自然语言即可创建自定义嵌入空间的方法。

关键词

引用

@article{arxiv.2211.12760,
  title  = {InDiReCT: Language-Guided Zero-Shot Deep Metric Learning for Images},
  author = {Konstantin Kobs and Michael Steininger and Andreas Hotho},
  journal= {arXiv preprint arXiv:2211.12760},
  year   = {2022}
}

备注

Accepted to WACV 2023