中文

针对歧义人名查询结果的自举分组

信息检索 2013-12-09 v1

摘要

当今搜索引擎的主要排序特征反映了结果的流行度,并基于 PageRank、隐式反馈聚合等排序模型。虽然这些特征在广泛查询中能产生令人满意的结果,但它们加剧了歧义实体搜索的问题:仅当所寻人物由高排名网页代表且所有所需信息均包含在该页面中时,搜索人名才能获得满意结果。否则,用户必须重新表述/细化查询,或手动检查低排名结果以找到目标人物。解决此问题的一种可能方法是对结果进行聚类,使每个聚类代表答案集中出现的一位人物。然而,聚类搜索结果本身已被证明是一项困难的任务,且聚类质量通常中等。关于人物的丰富有用信息出现在 Web 2.0 平台中,如 LinkedIn、Wikipedia、Facebook 等。作为人工生成的信息,这些平台上的数据干净、聚焦且已消歧。我们表明,在搜索歧义人名时,可以利用此类平台的信息进行自举,从而根据其中出现的个体对结果进行分组。我们在一个手工标注的数据集上评估了我们的方法,该数据集包含针对 50 个歧义人名的 Google 查询所检索到的约 5,000 个网页。

关键词

引用

@article{arxiv.1312.1897,
  title  = {Bootstrapped Grouping of Results to Ambiguous Person Name Queries},
  author = {Toni Gruetze and Gjergji Kasneci and Zhe Zuo and Felix Naumann},
  journal= {arXiv preprint arXiv:1312.1897},
  year   = {2013}
}