基于加权模态融合与相似性的无需训练的零样态构面图像检索
计算机视觉与模式识别
2025-04-25 v4
摘要
构面图像检索 (Composed Image Retrieval, CIR) 将查询表述为参考图像与修改文本的组合,因其捕获用户意图的能力而成为一种新的图像搜索形式。然而,以监督方式训练 CIR 模型通常需要耗时的 (参考图像、文本修饰符、目标图像) 三元组收集。虽然现有的零样态 CIR (ZS-CIR) 方法消除了对特定下游数据集训练的需求,但仍需在大规模图像数据集上进行额外预训练。本文提出一种无需训练的 ZS-CIR 方法。我们的方法,加权模态融合与相似性用于 CIR (Weighted Modality fusion and similarity for CIR, WeiMoCIR),基于图像和文本模态可有效地使用简单加权平均将其组合的假设,从而可直接从参考图像和文本修饰符构建查询表示。为进一步提升检索性能,我们采用多模态大语言模型 (multimodal large language models, MLLMs) 为数据库图像生成图像说明,并通过加权平均将这些文本说明纳入相似性计算,与图像信息相结合。我们的方法简单易实现,经在 FashionIQ 和 CIRR 数据集上的实验验证其有效性。代码已公开于 https://github.com/whats2000/WeiMoCIR。
引用
@article{arxiv.2409.04918,
title = {Training-free Zero-shot Composed Image Retrieval via Weighted Modality Fusion and Similarity},
author = {Ren-Di Wu and Yu-Yen Lin and Huei-Fang Yang},
journal= {arXiv preprint arXiv:2409.04918},
year = {2025}
}
备注
14 pages, 6 figures, International Conference on Technologies and Applications of Artificial Intelligence (TAAI) Camera Ready