Context-I2W:将图像映射至上下文相关词以实现精准零样本组合图像检索
计算机视觉与模式识别
2023-12-22 v2
摘要
与需要昂贵标签训练任务特定模型的组合图像检索任务不同,零样本组合图像检索(ZS-CIR)涉及多样任务,具有广泛的可能与领域、场景、对象和属性相关的视觉内容操控意图。ZS-CIR任务的关键挑战是学习更准确的图像表示,该表示能针对各种操控描述对参考图像具有自适应注意力。本文提出一种新颖的上下文相关映射网络,名为Context-I2W,用于自适应地将与描述相关的图像信息转换为由描述组成的伪词令牌,以实现精准ZS-CIR。具体而言,意图视图选择器首先动态学习旋转规则,将同一图像映射至任务特定的操控视图。随后视觉目标提取器在多个可学习查询的引导下进一步捕获覆盖ZS-CIR任务中主要目标的局部信息。这两个互补模块协同工作,在无额外监督下将图像映射为上下文相关伪词令牌。我们的模型在四个ZS-CIR任务(包括领域转换、对象组合、对象操控和属性操控)上展现出强泛化能力。其相较最佳方法取得1.88%至3.60%的一致且显著的性能提升,并在ZS-CIR上达到新的最先进水平(state-of-the-art)。我们的代码见 https://github.com/Pter61/context-i2w。
引用
@article{arxiv.2309.16137,
title = {Context-I2W: Mapping Images to Context-dependent Words for Accurate Zero-Shot Composed Image Retrieval},
author = {Yuanmin Tang and Jing Yu and Keke Gai and Jiamin Zhuang and Gang Xiong and Yue Hu and Qi Wu},
journal= {arXiv preprint arXiv:2309.16137},
year = {2023}
}