中文

基于预训练视觉-语言模型在真实生活图像上的图像检索

计算机视觉与模式识别 2021-08-10 v1 计算与语言 信息检索

摘要

我们扩展了组合图像检索任务,其输入查询由一幅图像和一段描述如何修改该图像的简短文本组成。现有方法仅应用于窄域内的非复杂图像,如时尚产品,从而限制了在丰富图像与语言语境中深入视觉推理研究的范围。为解决此问题,我们收集了真实生活图像上的组合图像检索(CIRR)数据集,其包含超过 36,000 对众包、开放域图像及人工生成的修改文本。为将现有方法扩展至开放域,我们提出了 CIRPLANT,一种基于 transformer 的模型,它利用丰富的预训练视觉-语言(V&L)知识,以自然语言为条件修改视觉特征。随后通过修正后特征的最近邻查找完成检索。我们证明,凭借相对简单的架构,CIRPLANT 在开放域图像上优于现有方法,同时在现有窄域数据集(如时尚)上匹配最先进准确率。连同 CIRR 的发布,我们相信本工作将启发组合图像检索的进一步研究。

关键词

引用

@article{arxiv.2108.04024,
  title  = {Image Retrieval on Real-life Images with Pre-trained Vision-and-Language Models},
  author = {Zheyuan Liu and Cristian Rodriguez-Opazo and Damien Teney and Stephen Gould},
  journal= {arXiv preprint arXiv:2108.04024},
  year   = {2021}
}

备注

ICCV 2021. Dataset, code, and pre-trained models are released at https://cuberick-orion.github.io/CIRR/