球面线性插值与文本锚定用于零样本组合图像检索
计算机视觉与模式识别
2024-05-02 v1 人工智能
摘要
组合图像检索(CIR)是一项复杂的任务,它使用由图像和描述对该图像所需修改的标题构成的查询来检索图像。有监督的CIR方法表现出强大的性能,但它们依赖于昂贵的手动标注数据集,这限制了它们的可扩展性和更广泛的适用性。为了解决这些问题,先前的研究提出了基于伪词标记的零样本CIR(ZS-CIR)方法,这些方法利用投影模块将图像映射到词标记。然而,我们推测这种方法有一个缺点:投影模块扭曲了原始图像表示,并将生成的组合嵌入限制在文本侧。为了解决这个问题,我们引入了一种新颖的ZS-CIR方法,该方法使用球面线性插值(Slerp)通过识别图像和文本表示的中间嵌入来直接合并它们。此外,我们引入了文本锚定微调(TAT),一种在保持文本编码器固定的同时微调图像编码器的方法。TAT缩小了图像和文本之间的模态差距,使得Slerp过程更加有效。值得注意的是,TAT方法不仅在训练数据集规模和训练时间方面高效,而且它还是训练有监督CIR模型的优秀初始检查点,从而突显了其更广泛的潜力。将基于Slerp的ZS-CIR与TAT微调模型相结合,使得我们的方法能够在CIR基准测试中提供最先进的检索性能。
引用
@article{arxiv.2405.00571,
title = {Spherical Linear Interpolation and Text-Anchoring for Zero-shot Composed Image Retrieval},
author = {Young Kyun Jang and Dat Huynh and Ashish Shah and Wen-Kai Chen and Ser-Nam Lim},
journal= {arXiv preprint arXiv:2405.00571},
year = {2024}
}