中文

基于 Hadoop 利用志愿式大数据构建地名辞典

分布式、并行与集群计算 2014-02-10 v2

摘要

传统的地名辞典由权威测绘机构建立和维护。在大数据时代,可以通过挖掘网络中丰富的志愿地理信息(VGI),以数据驱动的方式构建地名辞典。在本研究中,我们基于 Hadoop 生态系统构建了一个可扩展的分布式平台和高性能地理处理工作流,以采集众包地名辞典条目。利用基于 Flickr 地理标记数据集的实验,我们发现,与传统桌面操作相比,在支持空间功能的 Hadoop 集群上运行的基于 MapReduce 的工作流可将处理时间缩短一个数量级。我们展示了如何利用这种新型空间计算基础设施来促进地名辞典研究。此外,我们引入了一种基于谱系的信任模型用于质量保证。这项工作为利用 Hadoop 集群丰富未来地名辞典提供了新见解,并为将 GIS 连接到云计算环境以迎接大数据地理分析的新前沿做出了贡献。

关键词

引用

@article{arxiv.1311.7676,
  title  = {Constructing Gazetteers from Volunteered Big Geo-Data Based on Hadoop},
  author = {Song Gao and Linna Li and Wenwen Li and Krzysztof Janowicz and Yue Zhang},
  journal= {arXiv preprint arXiv:1311.7676},
  year   = {2014}
}

备注

45 pages, 10 figures