中文

从 Wikipedia 挖掘实体的有趣冷知识

信息检索 2015-10-13 v1

摘要

冷知识是关于一个实体的任何事实,其之所以有趣是由于以下任何特征——不寻常性、唯一性、不可预测性或怪异性。此类有趣的事实出现在许多地方的“你知道吗?”栏目中。尽管冷知识是几乎不重要而无需了解的事实,但我们展示了它们在用户参与目的中的用法。这类有趣的事实通常会激发好奇心并吸引用户更多地与实体互动,从而促进重复参与。该论文引用了一些案例研究,这些研究显示了使用冷知识增加用户参与度或广泛宣传产品/服务的显著影响。在这篇论文中,我们提出了一种从 Wikipedia 页面挖掘实体冷知识的新方法。给定一个实体,我们的系统从其 Wikipedia 页面提取相关句子,并根据其作为冷知识的有趣程度生成一个排序的句子列表。我们系统的核心是一个趣味性排序器,它通过一组丰富的领域无关的语言特征和基于实体的特征来学习趣味性的概念。我们的排序模型是通过利用网络上现有的用户生成的冷知识数据进行训练的,而不是为电影领域创建新的标注数据。对于体育、名人、国家等其他领域,则需要按照论文中所述创建标注数据。我们在电影领域和名人领域评估了我们的系统,并观察到该系统的性能显著优于定义的基线。对结果的彻底定性分析表明,我们设计的丰富特征集确实有助于将有趣的冷知识呈现在顶级排名中。

关键词

引用

@article{arxiv.1510.03025,
  title  = {Mining Interesting Trivia for Entities from Wikipedia},
  author = {Abhay Prakash},
  journal= {arXiv preprint arXiv:1510.03025},
  year   = {2015}
}

备注

Part of the work presented in this dissertation has been published at IJCAI 2015 as following: "Abhay Prakash, Manoj K. Chinnakotla, Dhaval Patel and Puneet Garg. Did you know?- Mining Interesting Trivia for Entities from Wikipedia, In 24th International Joint Conference on Artificial Intelligence (IJCAI, 2015)." (Paper Link: http://ijcai.org/papers15/Papers/IJCAI15-446.pdf)