从大规模冗余数据中获取信息的经验法则
信息检索
2015-03-17 v1 数据库
数据分析、统计与概率
摘要
我们建立了一个从冗余数据中获取信息的抽象模型。我们假设从数据中进行随机采样过程,这些数据带有偏差地提供信息,并关注我们预期学习到的信息比例,该比例是 (i) 采样比例(召回率)和 (ii) 信息偏差变化(冗余分布)的函数。我们提出了两条稳健性不同的经验法则。我们首先证明,当信息偏差服从 Zipf 分布时,80-20 法则或帕累托原则出人意料地不成立,并且当随机采样总数据的 20% 时,我们预期学习到的信息少于 40%。然后我们解析证明,对于大规模数据集,来自幂律分布的随机采样会导致具有相同幂律指数的“截断分布”。第二条法则非常稳健,并且对于严重偏离严格幂律的分布也成立。我们进一步给出了一个在采样下完全保持不变的特定幂律函数族。最后,我们使用两个大型 Web 数据集验证了我们的模型:域名的链接分布和 delicious.com 上的标签分布。
引用
@article{arxiv.1012.3502,
title = {Rules of Thumb for Information Acquisition from Large and Redundant Data},
author = {Wolfgang Gatterbauer},
journal= {arXiv preprint arXiv:1012.3502},
year = {2015}
}
备注
40 pages, 17 figures; for details see the project page: http://uniquerecall.com