零样本组合图像检索的纯语言高效训练
计算机视觉与模式识别
2024-04-02 v2 信息检索
摘要
组合图像检索(Composed Image Retrieval, CIR)任务接收由图像和文本组成的复合查询,旨在针对这两种条件搜索相关图像。传统的 CIR 方法需要一个由查询图像、查询文本和目标图像构成的三元组训练数据集,其收集成本非常高昂。最近的一些工作致力于零样本(Zero-Shot, ZS)CIR 范式,以在不使用预先收集的三元组的情况下解决该问题。然而,由于训练期间输入文本缺乏多样性,现有的 ZS-CIR 方法表现出有限的主干可扩展性和泛化能力。我们提出了一种新颖的 CIR 框架,仅使用语言进行训练。我们的 LinCIR(Language-only training for CIR)可以通过一种名为自掩码投影(Self-Masking Projection, SMP)的新型自监督方法,仅使用文本数据集进行训练。我们将文本潜在嵌入投影到 token 嵌入空间,并通过替换原始文本的关键词 token 来构建新文本。然后,我们让新文本和原始文本具有相同的潜在嵌入向量。凭借这一简单策略,LinCIR 出奇地高效且高度有效;采用 CLIP ViT-G 主干的 LinCIR 在 48 分钟内即可完成训练,并在四个不同的 CIR 基准(CIRCO、GeneCIS、FashionIQ 和 CIRR)上展现出最佳的 ZS-CIR 性能,甚至在 FashionIQ 上超越了有监督方法。代码可在 https://github.com/navervision/lincir 获取
引用
@article{arxiv.2312.01998,
title = {Language-only Efficient Training of Zero-shot Composed Image Retrieval},
author = {Geonmo Gu and Sanghyuk Chun and Wonjae Kim and Yoohoon Kang and Sangdoo Yun},
journal= {arXiv preprint arXiv:2312.01998},
year = {2024}
}
备注
CVPR 2024 camera-ready; First two authors contributed equally; 17 pages, 3.1MB