中文

真实场景网络图像检索的跨媒体相似性评估

计算机视觉与模式识别 2018-01-09 v2

摘要

为了通过文本查询检索未标注图像,跨媒体相似性计算是关键要素。尽管新方法不断被提出,但将这些方法与大规模查询日志分析结合进行评估的工作很少。因此,这些方法在回答真实用户查询方面取得了多大进展尚不清楚。给定使用相对简单的文本/图像匹配计算跨媒体相似性的基线方法,先进模型取得了多少进展也不清楚。本文采用务实的方法回答这两个问题。查询根据所提出的查询视觉性度量自动分类,并随后关联到三个测试集上多个跨媒体相似性模型的评估。这种关联揭示,最先进方法的成功主要归因于它们在面向视觉的查询上的良好表现,而这类查询仅占真实用户查询的一小部分。为了量化当前进展,我们提出一种简单的 text2image 方法,用从大规模查询日志中选出的一组图像来表示新颖的测试查询。因此,计算测试查询与给定图像之间的跨媒体相似性归结为比较给定图像与所选图像之间的视觉相似性。在具有挑战性的 Clickture 数据集上的图像检索实验表明,所提出的 text2image 优于近期基于深度学习的替代方法。

关键词

引用

@article{arxiv.1709.01305,
  title  = {Cross-Media Similarity Evaluation for Web Image Retrieval in the Wild},
  author = {Jianfeng Dong and Xirong Li and Duanqing Xu},
  journal= {arXiv preprint arXiv:1709.01305},
  year   = {2018}
}

备注

14 pages, 10 figures, accepted by IEEE Transactions on Multimedia 2018