基于维基百科的世界文学:基于DBpedia的框架介绍
信息检索
2017-01-05 v1 计算与语言
摘要
在众多关于世界文学的见解中,我们的目标是通过分析世界文学在维基百科(拥有数百种语言的数百万篇文章)中的表征,从数字角度为讨论做出贡献。作为预备,我们介绍并比较了三种不同的方法来利用DBpedia(一个旨在从维基百科提取和提供结构化信息的社区项目)的数据识别维基百科上的作家。凭借我们的基本作家集合,我们分析了他们在15个最大的维基百科语言版本中如何被表征。我们将内在度量(主要考察文章的连通性)与外在度量(分析文章被读者访问的频率)相结合,并开发了评估我们结果的方法。我们的大部分发现似乎传达了一个相当保守、过时的世界文学版本,但这是一个基于可复现事实的版本,揭示了基于数百万人的编辑和阅读行为的隐性文学经典。尽管仍需解决一些已知问题,所引入的方法将帮助我们构建世界文学观测站,以进一步调查其代表性和偏差。
引用
@article{arxiv.1701.00991,
title = {World Literature According to Wikipedia: Introduction to a DBpedia-Based Framework},
author = {Christoph Hube and Frank Fischer and Robert Jäschke and Gerhard Lauer and Mads Rosendahl Thomsen},
journal= {arXiv preprint arXiv:1701.00991},
year = {2017}
}
备注
33 pages, 6 figures, 6 tables