中文

抽象图像在不同反向图像搜索引擎下的可检索性水平存在差异

计算机视觉与模式识别 2022-11-07 v1 信息检索

摘要

大量计算机视觉研究聚焦于自然图像,但技术文档通常由抽象图像组成,例如图表、绘图、示意图和原理图。通用网络搜索引擎发现抽象图像的效果如何?计算机视觉与机器学习的最新进展催生了反向图像搜索引擎。传统搜索引擎接受文本查询并返回包含图像的一组文档结果,而反向图像搜索接受图像作为查询并返回一组图像作为结果。本文评估了常见反向图像搜索引擎发现抽象图像的效果。我们开展了一项实验,利用来自 Wikimedia Commons 的图像,该网站已知被百度、必应、谷歌和 Yandex 良好索引。我们衡量了一幅图像被再次找到的难易程度(可检索性)、返回图像中相关的百分比(精确率),以及访问者在找到提交的图像前必须浏览的平均结果数(平均倒数排名)。当试图在相似图像中再次发现同一图像时,Yandex 表现最佳。当搜索包含特定图像的页面时,谷歌和 Yandex 在发现照片方面优于其他引擎,其精确率分别为 0.8191 和 0.8297。在这两种情况下,谷歌和 Yandex 对自然图像的表现均优于抽象图像,这两类图像间的可检索性差异最高达 54%。这些结果会影响任何将通用网络搜索引擎用于检索使用抽象图像的技术文档的人。

关键词

引用

@article{arxiv.2211.02115,
  title  = {Abstract Images Have Different Levels of Retrievability Per Reverse Image Search Engine},
  author = {Shawn M. Jones and Diane Oyen},
  journal= {arXiv preprint arXiv:2211.02115},
  year   = {2022}
}

备注

20 pages; 7 figures; to be published in the proceedings of the Drawings and abstract Imagery: Representation and Analysis (DIRA) Workshop from ECCV 2022