中文

组合文本与图像用于图像检索——一项实证探索

计算机视觉与模式识别 2018-12-19 v1

摘要

本文研究图像检索任务,其中输入查询以一幅图像加若干描述对该输入图像所需修改的文本形式给出。例如,我们可给出埃菲尔铁塔的图像,并要求系统寻找视觉上相似但经细微修改的图像,如改为夜间而非白天拍摄。为应对该任务,我们学习目标图像与源图像加源文本之间的相似性度量,即一种嵌入与组合函数,使得目标图像特征接近源图像加文本组合特征。我们提出一种利用此类函数组合图像与文本的新方式,专为检索任务设计。我们在三个不同数据集(即 Fashion-200k、MIT-States 以及我们基于 CLEVR 创建的新合成数据集)上显示其优于现有方法。我们还展示除图像检索外,本方法可用于对输入查询进行分类。

关键词

引用

@article{arxiv.1812.07119,
  title  = {Composing Text and Image for Image Retrieval - An Empirical Odyssey},
  author = {Nam Vo and Lu Jiang and Chen Sun and Kevin Murphy and Li-Jia Li and Li Fei-Fei and James Hays},
  journal= {arXiv preprint arXiv:1812.07119},
  year   = {2018}
}