中文

Tangent 搜索引擎:改进的相似度度量与数学公式检索的可扩展性

信息检索 2015-07-23 v1

摘要

随着全球数据数量和种类的不断增加,万维网已成为数学公式的丰富存储库。这就需要创建稳健且可扩展的数学信息检索系统,用户可以使用单独的公式(表达式查询)或关键词与公式的组合来搜索数学信息。通常,最能满足用户信息需求的页面包含的表达式仅与查询公式近似匹配。对于试图定位或重新查找特定表达式、浏览相似公式或数学非专业用户的用户来说,公式之间的相似度更多地取决于符号的相对位置,而非深层数学语义。我们提出了用于表达式查询的最大子树相似度(MSS)度量,该度量基于公式的外观——即符号的类型和相对位置——产生直观的公式排名。由于将该度量应用于大型集合中的所有公式代价过高,我们首先使用倒排索引检索表达式,该索引编码了符号对之间的关系,并使用 Dice 系数对命中结果进行排名。然后使用 MSS 对前 k 个公式进行重新排名。我们的方法在 NTCIR-11 Wikipedia 公式检索基准上取得了最先进的性能,并且在索引空间和整体检索时间方面都高效。其他图形形式的检索系统,包括化学图、流程图、图和表,也可能从采用我们的方法中受益。

关键词

引用

@article{arxiv.1507.06235,
  title  = {The Tangent Search Engine: Improved Similarity Metrics and Scalability for Math Formula Search},
  author = {Richard Zanibbi and Kenny Davila and Andrew Kane and Frank Tompa},
  journal= {arXiv preprint arXiv:1507.06235},
  year   = {2015}
}

备注

10 pages