零样本组合图像检索的数据高效泛化
计算机视觉与模式识别
2025-03-10 v1
摘要
零样本组合图像检索(ZS-CIR)旨在根据参考图像和文本描述检索目标图像,无需使用分布内三元组进行训练。一种常见的方法遵循视觉语言预训练范式,该范式使用映射网络将图像嵌入转移到文本嵌入空间中的伪词标记。然而,由于训练与推理之间的模态差异和分布偏移,该方法往往阻碍网络的泛化能力。为此,我们提出了一种数据高效泛化(DeG)框架,包括两种新颖设计,即文本补充(TS)模块和语义集(S-Set)。TS 模块在训练过程中利用组合文本语义,用更多语言语义增强伪词标记,从而有效缓解模态差异。S-Set 利用预训练视觉语言模型(VLM)的零样本能力,缓解分布偏移并减轻大规模图像-文本数据冗余带来的过拟合问题。在四个 ZS-CIR 基准上的大量实验表明,DeG 以更少的训练数据超越了最先进(SOTA)方法,并为实际使用节省了大量训练和推理时间。
引用
@article{arxiv.2503.05204,
title = {Data-Efficient Generalization for Zero-shot Composed Image Retrieval},
author = {Zining Chen and Zhicheng Zhao and Fei Su and Xiaoqin Zhang and Shijian Lu},
journal= {arXiv preprint arXiv:2503.05204},
year = {2025}
}