无视觉检索:基于文本场景描述重新思考多模态搜索
计算机视觉与模式识别
2025-09-24 v1
摘要
对比训练的视觉语言模型(VLMs),如 CLIP,已成为学习判别性视觉语言表示的标准方法。然而,这些模型通常表现出浅层的语言理解能力,呈现词袋行为。这些局限性因其双编码器设计而被加剧,该设计导致了模态鸿沟。此外,依赖海量网络收集的数据语料库进行训练使得该过程计算成本高昂,并引入了显著的隐私问题。为了解决这些局限性,在本文中,我们通过引入无视觉的单编码器检索流水线,挑战了视觉编码器在检索任务中的必要性。我们摆脱传统的文本到图像检索范式,在 VLLM 生成的结构化图像描述的辅助下,迁移到文本到文本的范式。我们证明这种范式转变具有显著优势,包括大幅减小模态鸿沟、提升组合性,以及在短和长标题查询上的更好性能,所有这些仅需在两个 GPU 上进行几个小时的校准即可实现。此外,用文本描述替代原始图像为检索引入了一种更有利于隐私的替代方案。为了进一步评估泛化能力并解决先前组合性基准测试的一些缺陷,我们发布了两个源自 Flickr30k 和 COCO 的基准测试,包含由短标题组成的多样化组合性查询,我们将其命名为 subFlickr 和 subCOCO。我们的无视觉检索器匹配并经常超越传统的多模态模型。重要的是,我们的方法在多个检索和组合性基准测试上实现了 SOTA 的零样本性能,模型参数量仅为 0.3B。代码可在以下地址获取:https://github.com/IoannaNti/LexiCLIP
引用
@article{arxiv.2509.19203,
title = {Vision-Free Retrieval: Rethinking Multimodal Search with Textual Scene Descriptions},
author = {Ioanna Ntinou and Alexandros Xenos and Yassine Ouali and Adrian Bulat and Georgios Tzimiropoulos},
journal= {arXiv preprint arXiv:2509.19203},
year = {2025}
}
备注
Accepted at EMNLP 2025