中文

面向长尾实体的文档过滤

信息检索 2016-09-15 v1

摘要

在知识库构建与维护的背景下,过滤与实体相关的文档是一项关键任务。它需要处理一个按时间排序的、可能与某实体相关的文档流,以便仅选择那些包含重要信息的文档。针对热门实体的文档过滤的现有方法依赖于实体:它们依赖并基于每个特定实体的区分特征的具体细节进行训练。此外,这些方法倾向于使用所谓的外部信息,如 Wikipedia 页面浏览量和相关实体,这些信息通常仅对热门头部实体可用。因此,基于此类信号的实体依赖方法不适合作为长尾实体的过滤方法。在本文中,我们提出了一种面向长尾实体的文档过滤方法,该方法独立于实体,因此也能泛化到未见或极少见的实体。它基于内在特征,即从提及实体的文档中提取的特征。我们提出了一组捕捉信息量、实体显著性和时效性的特征。具体而言,我们引入了基于实体方面相似性、关系模式和时间表达的特征,并将这些与文档过滤的标准特征相结合。在公开数据集上遵循 TREC KBA 2014 设置的实验表明,我们的模型能够在多个基线上提升长尾实体的过滤性能。将该模型应用于未见实体的结果令人鼓舞,表明该模型能够学习重要文档的一般特征。跨所有实体(即不仅是长尾实体)的整体性能在不依赖任何实体特定训练数据的情况下超越了现有水平。

关键词

引用

@article{arxiv.1609.04281,
  title  = {Document Filtering for Long-tail Entities},
  author = {Ridho Reinanda and Edgar Meij and Maarten de Rijke},
  journal= {arXiv preprint arXiv:1609.04281},
  year   = {2016}
}

备注

CIKM2016, Proceedings of the 25th ACM International Conference on Information and Knowledge Management. 2016