SQUARE:面向免训练零样本组合图像检索的语义查询增强融合与高效批量重排序
计算机视觉与模式识别
2025-10-01 v1 信息检索
摘要
组合图像检索(CIR)旨在检索出既保留参考图像的视觉内容,又融合了用户指定文本修改的目标图像。免训练的零样本CIR(ZS-CIR)方法无需特定任务训练或标注数据,因此非常理想,但准确捕捉用户意图仍然具有挑战性。在本文中,我们提出了SQUARE,一个新颖的两阶段免训练框架,它利用多模态大语言模型(MLLMs)来增强ZS-CIR。在语义查询增强融合(SQAF)阶段,我们利用MLLM生成的目标图像描述来丰富从视觉语言模型(VLM)(如CLIP)导出的查询嵌入。这些描述提供了高级语义指导,使查询能够更好地捕捉用户意图并提高全局检索质量。在高效批量重排序(EBR)阶段,排名靠前的候选图像以带有视觉标记的图像网格形式呈现给MLLM,MLLM对所有候选进行联合视觉语义推理。我们的重排序策略单次执行即可产生更准确的排序。实验表明,SQUARE凭借其简洁性和有效性,在四个标准CIR基准上展现了强大的性能。值得注意的是,即使使用轻量级预训练模型,它也能保持高性能,展示了其潜在的应用价值。
引用
@article{arxiv.2509.26330,
title = {SQUARE: Semantic Query-Augmented Fusion and Efficient Batch Reranking for Training-free Zero-Shot Composed Image Retrieval},
author = {Ren-Di Wu and Yu-Yen Lin and Huei-Fang Yang},
journal= {arXiv preprint arXiv:2509.26330},
year = {2025}
}
备注
20 pages, 9 figures