中文

基于对比学习和任务导向 CLIP 特征的合成图像检索

计算机视觉与模式识别 2023-08-23 v1

摘要

给定一个由参考图像和相对文本描述组成的查询,合成图像检索的目标是检索在视觉上与参考图像相似且融合了文本描述所表达修改的图像。鉴于近期研究已证明大规模视觉语言预训练(VLP)模型在多种任务中的有效性,我们依赖 OpenAI CLIP 模型的特征来解决所考虑的任务。我们首先使用视觉与文本特征逐元素之和对两个 CLIP 编码器进行任务导向的微调。然后,在第二阶段,我们训练一个 Combiner 网络,学习结合图像-文本特征以整合双模态信息,并提供用于执行检索的组合特征。我们在两个训练阶段都使用对比学习。以原始 CLIP 特征为基线,实验结果表明,任务导向的微调和精心设计的 Combiner 网络非常有效,并在 FashionIQ 和 CIRR(两个流行且具有挑战性的合成图像检索数据集)上优于更复杂的当前最优方法。代码和预训练模型可在 https://github.com/ABaldrati/CLIP4Cir 获取。

关键词

引用

@article{arxiv.2308.11485,
  title  = {Composed Image Retrieval using Contrastive Learning and Task-oriented CLIP-based Features},
  author = {Alberto Baldrati and Marco Bertini and Tiberio Uricchio and Alberto del Bimbo},
  journal= {arXiv preprint arXiv:2308.11485},
  year   = {2023}
}

备注

Accepted in ACM Transactions on Multimedia Computing Communications and Applications (TOMM)