基于视觉转语言的免训练组合图像检索
计算机视觉与模式识别
2024-02-27 v2
摘要
给定一幅图像和一个目标修改(例如埃菲尔铁塔的图像与文本“无人群且夜间”),组合图像检索(CIR)旨在从数据库中检索相关的目标图像。虽然有监督方法依赖于标注三元组,成本高昂(即查询图像、文本修改和目标图像),近期研究通过使用大规模视觉-语言模型(VLM)规避了这一需求,实现了零样本CIR(ZS-CIR)。然而,ZS-CIR中的最先进方法仍需要在大量图像-文本对上训练任务特定的定制模型。本工作中,我们提出以免训练方式解决CIR,通过我们的“视觉转语言组合图像检索”(CIReVL)——一个简单但人类可理解且可扩展的流程,有效重组大规模VLM与大型语言模型(LLM)。通过使用预训练生成式VLM为参考图像生成描述,并让LLM基于文本目标修改重新组合描述以通过例如CLIP进行后续检索,我们实现了模块化语言推理。在四个ZS-CIR基准上,我们取得了有竞争力的、部分达到最先进的性能——优于有监督方法。此外,CIReVL的模块化提供了无需重新训练的简易可扩展性,使我们既能研究ZS-CIR的缩放定律与瓶颈,又能轻松扩展至部分超过先前报告结果一倍以上。最后,我们展示CIReVL通过在语言域以模块化方式组合图像与文本使CIR人类可理解,从而使其可干预,允许事后重新对齐失败案例。代码将在接收后发布。
引用
@article{arxiv.2310.09291,
title = {Vision-by-Language for Training-Free Compositional Image Retrieval},
author = {Shyamgopal Karthik and Karsten Roth and Massimiliano Mancini and Zeynep Akata},
journal= {arXiv preprint arXiv:2310.09291},
year = {2024}
}
备注
ICLR 2024