企业注册大数据填补:支撑中国产业的时空分析
计算机与社会
2018-05-23 v2 性能
摘要
包含时间与位置信息的大规模细粒度企业注册数据,使我们能够在多重尺度上跨时空定量地分析、可视化并理解产业格局。然而,不完整与歧义等数据质量问题阻碍了此类分析与应用。当数据体量巨大且持续增长时,这些问题更具挑战性。高性能计算(HPC)框架可应对大数据计算问题,但鲜有研究在此类计算环境下系统考察企业注册数据的填补方法。本文提出一种基于 Apache Spark 及裸金属计算集群的大数据填补工作流,以对企业注册数据进行填补。我们整合外部数据源,采用自然语言处理(NLP),并比较若干机器学习方法,以解决企业注册数据中的不完整与歧义问题。实验结果说明了所提出的基于 HPC 的填补框架的可行性、效率与可扩展性,也为其他大型地理参考文本数据处理提供了参考。利用这些填补结果,我们可视化并简要讨论了中国产业的时空分布,展示了此类数据在质量问题得以解决后的潜在应用。
引用
@article{arxiv.1804.03562,
title = {Big enterprise registration data imputation: Supporting spatiotemporal analysis of industries in China},
author = {Fa Li and Zhipeng Gui and Huayi Wu and Jianya Gong and Yuan Wang and Siyu Tian and Jiawen Zhang},
journal= {arXiv preprint arXiv:1804.03562},
year = {2018}
}
备注
15 pages, 15 figures