中文

Wikipedia增长过程中语言的稳健聚类

数字图书馆 2017-10-20 v1 社会与信息网络 数据分析、统计与概率 物理与社会 应用统计

摘要

Wikipedia 是在真正的众包支持下不断增长的现存最大知识库。虽然英文 Wikipedia 是最庞大且研究最深入的,拥有超过五百万篇文章,但对其余 283 个较小规模 Wikipedia 的行为和增长却知之甚少,其中最小的 Afar 语 Wikipedia 只有一篇文章。在此,我们使用该数据的一个子集,包含 14962 篇不同的文章,每篇文章均以 26 种不同的语言存在,从阿拉伯语到乌克兰语。我们研究了这些语言的 Wikipedia 在 15 年的时间跨度内的增长。我们表明,尽管平均而言一篇文章从一种语言随机传播到另一种语言,但存在六个定义明确的 Wikipedia 聚类,它们共享共同的增长模式。正如我们通过四种不同的聚类方法所验证的,这些聚类的构成对于用于确定它们的方法具有显著的稳健性。有趣的是,所识别出的 Wikipedia 聚类与语系和语族几乎没有相关性。相反,不同语言的 Wikipedia 增长受不同因素支配,从文化相似性到信息素养。

关键词

引用

@article{arxiv.1709.06556,
  title  = {Robust clustering of languages across Wikipedia growth},
  author = {Kristina Ban and Matjaz Perc and Zoran Levnajic},
  journal= {arXiv preprint arXiv:1709.06556},
  year   = {2017}
}

备注

9 two-column pages, 7 figures; accepted for publication in Royal Society Open Science