中文

来自非合作查询的高效媒体检索

信息检索 2014-11-20 v1 计算机视觉与模式识别

摘要

文本在人工世界中无处不在,且在获取书籍标题和作者姓名时易于获得。利用来自 Stanford Mobile Visual Search 数据集的书籍封面图像集,以及来自 openlibrary.org 的额外书籍封面和元数据,我们构建了一个大规模书籍封面检索数据集,其中包含 100K 个干扰封面以及每本书的标题和作者字符串。由于我们的查询图像不利于清晰的文本提取,我们提出了一种提取匹配噪声且错误的 OCR 读数的方法,并将其在标准文档查找问题设置中与清晰的作者和书籍标题字符串进行匹配。最后,我们展示了如何在简单的学习设置中将这种文本匹配作为特征,与 VLAD 等流行检索特征结合使用,从而实现比单独使用 VLAD 或文本更显著的检索精度提升。

关键词

引用

@article{arxiv.1411.5307,
  title  = {Efficient Media Retrieval from Non-Cooperative Queries},
  author = {Kevin Shih and Wei Di and Vignesh Jagadeesh and Robinson Piramuthu},
  journal= {arXiv preprint arXiv:1411.5307},
  year   = {2014}
}

备注

8 pages, 9 figures, 1 table