模态与任务适应增强零样本组合图像检索
计算机视觉与模式识别
2025-08-07 v2 信息检索
摘要
作为一项具有挑战性的视觉-语言任务,零样本组合图像检索(ZS-CIR)旨在利用双模态(图像+文本)查询检索目标图像。典型的ZS-CIR方法采用逆置网络生成伪词元,以有效表示输入语义。然而,基于逆置的方法存在两个固有问题:第一,任务差异——逆置训练与CIR推理涉及不同的目标;第二,模态差异——训练与推理之间输入特征分布的不匹配。为此,我们提出了一种轻量级的后处理框架,包含两个组件:(1) 一种新的以文本为锚点的三元组构建流程,利用大语言模型(LLM)将标准图像-文本数据集转换为三元组数据集,其中文本描述作为每个三元组的目标。(2) MoTa-Adapter,一种新颖的参数高效微调方法,利用我们构建的三元组数据将双编码器适配到CIR任务。具体而言,在文本侧,通过专家混合(MoE)层集成多组可学习的任务提示,以捕捉任务先验并处理不同类型的修改;在图像侧,MoTa-Adapter调节逆置网络的输入以更好地匹配下游编码器。此外,提出了一种基于熵的优化策略,为困难样本分配更大权重,从而确保高效适应。实验表明,在纳入我们提出的组件后,基于逆置的方法取得了显著提升,在四个广泛使用的基准上达到了最先进性能。所有数据和代码将公开发布。
引用
@article{arxiv.2410.23736,
title = {Modality and Task Adaptation for Enhanced Zero-shot Composed Image Retrieval},
author = {Haiwen Li and Fei Su and Zhicheng Zhao},
journal= {arXiv preprint arXiv:2410.23736},
year = {2025}
}