中文

基于 MLLM 引导的 VLM 微调与联合推理用于零样本组合图像检索

计算机视觉与模式识别 2025-05-27 v1 信息检索

摘要

现有的零样本组合图像检索(ZS-CIR)方法通常训练适配器将参考图像转换为伪文本 token,这些 token 与修改文本拼接后由预训练 VLM 或 LLM 中冻结的文本编码器处理。尽管这种设计利用了大型预训练模型的优势,但它仅监督适配器生成与编码器兼容的 token,从而松散地保留了视觉语义。关键在于,它没有直接优化组合查询表示以捕捉组合的完整意图或与目标语义对齐,从而限制了检索性能,特别是在涉及细粒度或复杂视觉变换的情况下。为了解决这个问题,我们提出了基于 MLLM 引导的 VLM 微调与联合推理(MVFT-JI),这是一种新颖的方法,利用预训练的多模态大型语言模型(MLLM)仅使用无标签图像构建两个互补的训练任务:目标文本检索任务和文本到图像检索任务。通过联合优化这些任务,我们的方法使 VLM 能够固有地获得稳健的组合检索能力,这一点得到了所提供的理论证明和实证验证的支持。此外,在推理过程中,我们进一步提示 MLLM 从组合查询生成目标文本,并通过整合(i)组合查询与候选图像之间以及(ii)MLLM 生成的目标文本与候选图像之间的相似度来计算检索分数。该策略有效地将 VLM 的语义对齐优势与 MLLM 的推理能力相结合。

关键词

引用

@article{arxiv.2505.19707,
  title  = {MLLM-Guided VLM Fine-Tuning with Joint Inference for Zero-Shot Composed Image Retrieval},
  author = {Rong-Cheng Tu and Zhao Jin and Jingyi Liao and Xiao Luo and Yingjie Wang and Li Shen and Dacheng Tao},
  journal= {arXiv preprint arXiv:2505.19707},
  year   = {2025}
}