新加坡新闻的可视化与预测分析:基于GDELT、维基百科和^STI的实验
其他计算机科学
2014-04-09 v1
摘要
开源全球事件、语言与语调数据库(GDELT)是从国际新闻文章中提取重要术语的最全面、最新的大数据源。我们仅关注GDELT中与新加坡相关的事件,以更好地理解其新闻文章的数据质量、术语提取的准确性以及预测潜力。为测试新闻的完整性和有效性,我们将GDELT(1979年至2013年新加坡新闻文章术语)与维基百科的新加坡历史时间线进行了可视化比较。为测试术语提取的准确性,我们将GDELT(2013年4月至12月新加坡新闻文章文本的CAMEO代码和TABARI提取系统)与SAS文本挖掘器的术语和主题提取进行了可视化比较。为进行预测分析,我们提出了一种新颖的特征工程方法,将行级GDELT从文章转换为用户指定的时间分辨率。例如,我们使用决策树,利用GDELT每日特征值计数来预测新加坡股市的海峡时报指数(^STI)。上述结果中具有实际意义的是,SAS可视化分析能够突出显示2013年6月东南亚雾霾和2013年12月小印度骚乱对新加坡的各种影响。尽管新加坡作为一个主权城市国家具有独特性,是一个领先的金融中心,具有强大的国际影响力,并且人口高度多元文化,但本文报告的可视化和预测分析高度适用于其他国家的GDELT数据。
引用
@article{arxiv.1404.1996,
title = {Visual and Predictive Analytics on Singapore News: Experiments on GDELT, Wikipedia, and ^STI},
author = {Clifton Phua and Yuzhang Feng and Junyao Ji and Timothy Soh},
journal= {arXiv preprint arXiv:1404.1996},
year = {2014}
}
备注
19 pages, 16 figures, 3 tables