寻找用本体论术语注释的对象的前k个最佳相似对
数据库
2010-03-09 v2
摘要
随着对语义搜索和解释的日益关注,越来越多的标准化词汇表和本体被设计并用于描述数据。我们研究了由树结构本体描述的对象的查询。具体而言,我们考虑在对象描述仅在运行时可用的情况下,寻找用此类本体中的术语注释的对象的前k个最佳对。我们考虑了三种距离度量。第一种将对象距离定义为描述它们的术语集之间的最小成对距离,第二种将距离定义为平均成对术语距离。第三种且最实用的距离度量——推土机距离,找到匹配术语的最佳方式,并计算与此最佳匹配对应的距离。我们开发了可逐步聚合的下界,并在使用推土机距离时利用它们加速前k个对象对的搜索。对于最小成对距离,我们设计了一个运行时间为O(D + Tk log k)的算法,其中D是总信息大小,T是本体中的术语总数。我们还为平均成对距离开发了一种新颖的最佳优先搜索策略,该策略利用按顺序生成的下界。在真实和合成数据集上的实验证明了我们算法的实用性和可扩展性。
引用
@article{arxiv.1001.2625,
title = {Finding top-k similar pairs of objects annotated with terms from an ontology},
author = {Arnab Bhattacharya and Abhishek Bhowmick and Ambuj K. Singh},
journal= {arXiv preprint arXiv:1001.2625},
year = {2010}
}
备注
17 pages, 13 figures