中文

从大规模冗余数据中获取信息的经验法则

信息检索 2015-03-17 v1 数据库 数据分析、统计与概率

摘要

我们建立了一个从冗余数据中获取信息的抽象模型。我们假设从数据中进行随机采样过程,这些数据带有偏差地提供信息,并关注我们预期学习到的信息比例,该比例是 (i) 采样比例(召回率)和 (ii) 信息偏差变化(冗余分布)的函数。我们提出了两条稳健性不同的经验法则。我们首先证明,当信息偏差服从 Zipf 分布时,80-20 法则或帕累托原则出人意料地不成立,并且当随机采样总数据的 20% 时,我们预期学习到的信息少于 40%。然后我们解析证明,对于大规模数据集,来自幂律分布的随机采样会导致具有相同幂律指数的“截断分布”。第二条法则非常稳健,并且对于严重偏离严格幂律的分布也成立。我们进一步给出了一个在采样下完全保持不变的特定幂律函数族。最后,我们使用两个大型 Web 数据集验证了我们的模型:域名的链接分布和 delicious.com 上的标签分布。

关键词

引用

@article{arxiv.1012.3502,
  title  = {Rules of Thumb for Information Acquisition from Large and Redundant Data},
  author = {Wolfgang Gatterbauer},
  journal= {arXiv preprint arXiv:1012.3502},
  year   = {2015}
}

备注

40 pages, 17 figures; for details see the project page: http://uniquerecall.com