中文

SCOT:用于零样本组合检索的自监督对比预训练

计算机视觉与模式识别 2025-01-16 v1 人工智能

摘要

组合图像检索(CIR)是一种多模态学习任务,模型需将查询图像与用户提供的文本修改组合,以检索目标图像。CIR 在包括产品检索(电商)和网络搜索等多个领域具有应用。现有方法主要关注完全监督学习,即在 FashionIQ 和 CIRR 等标记化三元组数据集上进行训练。这带来两个显著挑战:(i) 编排此类三元组数据集需要大量人力; (ii) 模型缺乏对未见对象和领域的泛化能力。本文提出 SCOT(自监督 COmpositional Training),一种新颖的零样本组合预训练策略,结合大规模图像文本对数据集与大语言模型的生成能力,对嵌入组合网络进行对比式训练。具体而言,我们展示了大规模对比预训练的视觉语言模型的文本嵌入可被用作组合预训练中的代理目标监督,取代目标图像嵌入。在零样本设置下,该策略在 FashionIQ 和 CIRR 等标准基准上超越了 SOTA 零样本组合检索方法以及许多完全监督方法。

关键词

引用

@article{arxiv.2501.08347,
  title  = {SCOT: Self-Supervised Contrastive Pretraining For Zero-Shot Compositional Retrieval},
  author = {Bhavin Jawade and Joao V. B. Soares and Kapil Thadani and Deen Dayal Mohan and Amir Erfan Eshratifar and Benjamin Culpepper and Paloma de Juan and Srirangaraj Setlur and Venu Govindaraju},
  journal= {arXiv preprint arXiv:2501.08347},
  year   = {2025}
}

备注

Paper accepted at WACV 2025 in round 1