实例匹配技术中属性自动生成权重的高效度量
人工智能
2015-02-13 v1
摘要
语义知识库的异构数据源的激增加剧了对自动实例匹配技术的需求。然而,实例匹配的效率常常受到与实例相关联的属性的权重的影响。自动权重生成在实例匹配技术中是一项重要但非平凡的任务。因此,确定一种合适的度量来自动生成属性权重仍然是一项艰巨的任务。在本文中,我们研究了一种通过考虑以下假设来自动生成权重的方法:(1) 属性的权重与其不同值的数量与包含该属性的实例的数量之比成正比;(2) 权重也与属性的不同值的数量与训练数据集中实例的数量之比成正比。我们使用该方法背后的基本直觉是信息内容的经典理论,即低频词比高频词更具信息量。我们的数学模型推导出一种用于自动生成属性权重的度量,该度量应用于实例匹配系统以高效地产生重新调和的实例。我们的实验与评估显示了我们提出的用于实例匹配技术中属性自动权重生成的度量的有效性。
引用
@article{arxiv.1502.03556,
title = {An Efficient Metric of Automatic Weight Generation for Properties in Instance Matching Technique},
author = {Md. Hanif Seddiqui and Rudra Pratap Deb Nath and Masaki Aono},
journal= {arXiv preprint arXiv:1502.03556},
year = {2015}
}
备注
17 pages, 5 figures, 3 tables, pp. 1-17, publication year 2015, journal publication, vol. 6 number 1