FLEX-CLIP:基于特征级生成网络增强的 CLIP 用于 X-shot 跨模态检索
计算机视觉与模式识别
2024-11-27 v1 计算与语言
摘要
给定来自一个模态的查询,few-shot 跨模态检索(CMR)检索与之在另一个模态中语义相似的实例,目标域包括与源域不相交的类。与经典的 few-shot CMR 方法相比,视觉-语言预训练方法如 CLIP 在 few-shot 或 zero-shot 学习方面表现出色。然而,它们仍面临两个挑战:(1)在目标域中发生的特征退化,以及(2)极端的数据不平衡。为此,我们提出了 FLEX-CLIP,即 Feature-level Generation Network Enhanced CLIP。FLEX-CLIP 包含两个训练阶段。在多模态特征生成中,我们提出了一种复合多模态 VAE-GAN 网络来捕获真实特征分布模式,并基于 CLIP 特征生成伪样本,以解决数据不平衡问题。对于常见空间投影,我们开发了一个门控残差网络来融合 CLIP 特征与投影特征,减少 X-shot 场景中的特征退化。实验在四个基准数据集上进行,结果显示相较于最先进的方法提高了 7%-15%,并且通过消融研究表明显著增强了 CLIP 特征。
关键词
引用
@article{arxiv.2411.17454,
title = {FLEX-CLIP: Feature-Level GEneration Network Enhanced CLIP for X-shot Cross-modal Retrieval},
author = {Jingyou Xie and Jiayi Kuang and Zhenzhou Lin and Jiarui Ouyang and Zishuo Zhao and Ying Shen},
journal= {arXiv preprint arXiv:2411.17454},
year = {2024}
}