像推理一样预训练:掩码微调提升零样本组合图像检索
计算机视觉与模式识别
2025-04-01 v3
摘要
零样本组合图像检索(ZS-CIR)以文本修改与参考图像作为查询,在无三元组标注的情况下检索目标图像,在数据挖掘中日益受到关注。当前 ZS-CIR 研究主要依赖预训练视觉-语言模型的泛化能力,如 CLIP。然而,预训练视觉-语言模型与 CIR 任务存在显著差距:前者侧重学习相似性,而 CIR 旨在学习文本引导下的图像修改。本文提出一种新颖的无标注预训练掩码微调方法,缩小预训练视觉-语言模型与下游 CIR 任务间的鸿沟。首先,为缩小差距,我们将视觉-语言模型的对比学习重构为 CIR 任务,从图像-文本对中随机掩码图像块以生成 掩码图像, 文本, 图像 三元组。随后,我们提出一种简单而新颖的预训练掩码微调方法,利用文本与掩码图像学习原始图像的修改。凭借如此简单的设计,所提掩码微调能更好地捕捉细粒度文本引导的修改。大量实验表明,在 FashionIQ、CIRR、CIRCO 与 GeneCIS 四个 ZS-CIR 数据集上,我们的方法显著优于基线模型。代码见 https://github.com/Chen-Junyang-cn/PLI
引用
@article{arxiv.2311.07622,
title = {Pretrain like Your Inference: Masked Tuning Improves Zero-Shot Composed Image Retrieval},
author = {Junyang Chen and Hanjiang Lai},
journal= {arXiv preprint arXiv:2311.07622},
year = {2025}
}
备注
accepted by ICME 2025, this is the full version of paper