中文

RAProp:利用推文/用户/网络生态系统及推文间一致性对推文进行排序

信息检索 2013-08-13 v1

摘要

Twitter 的日益普及使得对推文的可信度和相关性评估对于搜索变得更为重要。然而,鉴于推文长度的限制,仅从推文内容中提取排序指标十分困难。我们提出了一种名为 RAProp 的新颖排序方法,该方法结合了衡量推文相关性和可信度的两个正交指标。第一个指标称为特征得分(Feature Score),通过从由用户、推文以及推文中引用的页面组成的三层 Twitter 生态系统中提取特征,来衡量推文来源的可信度。第二个指标称为一致性分析(agreement analysis),通过分析推文内容是否以及如何被其他推文独立证实,来估计推文内容的可信度。我们将候选推文结果集视为图的顶点,边则衡量每对推文之间的估计一致性。特征得分在此一致性图上传播,以计算出既具有可信来源又拥有独立证实的前 k 条推文。在 TREC 2011 微博数据集(Microblog Dataset)的 1600 万条推文上对我们方法的评估显示,在前 30 条结果的精确度(precision)上,我们比该数据集上当前表现最佳的方法高出 53%,比当前的 Twitter 搜索高出 300% 以上。我们还提供了 RAProp 与我们提出的几种替代方法的详细内部实证评估。

关键词

引用

@article{arxiv.1308.2354,
  title  = {RAProp: Ranking Tweets by Exploiting the Tweet/User/Web Ecosystem and Inter-Tweet Agreement},
  author = {Srijith Ravikumar and Kartik Talamadupula and Raju Balakrishnan and Subbarao Kambhampati},
  journal= {arXiv preprint arXiv:1308.2354},
  year   = {2013}
}

备注

11 pages