中文

利用全局约束改进实体解析

数据库 2011-08-31 v1 信息检索

摘要

网络搜索的一些最重大进展来自于利用在线用户行为的社会经济属性。以往的进展包括 PageRank、锚文本、枢纽-权威以及 TF-IDF。本文研究了另一种据我们所知尚未被利用的社会经济属性:创建实体列表的网站(如 IMDB 和 Netflix)有动机避免无谓的重复条目。我们利用这一属性来解析不同网站间的实体,并发现可以显著提高解析准确率。这种准确率的提升也转化为鲁棒性,通常能减少为跨多个网站比较实体而必须标注的训练数据量。此外,该技术在解析存在部分重复的网站时提供了鲁棒性,甚至无需事先移除这些重复。我们提出了具有极高精确率和召回率的算法,并表明最大权重匹配虽然看似一个自然的选择,但在某些情况下性能却很差。所提出的技术现正用于一家主流互联网搜索引擎的后端实体解析系统中。

关键词

引用

@article{arxiv.1108.6016,
  title  = {Improving Entity Resolution with Global Constraints},
  author = {Jim Gemmell and Benjamin I. P. Rubinstein and Ashok K. Chandra},
  journal= {arXiv preprint arXiv:1108.6016},
  year   = {2011}
}

备注

10 pages, 13 figures