中文

使用 Hadoop 对 Twitter 进行大规模分析:技术报告

数据库 2016-02-04 v1 计算与语言 信息检索

摘要

近期,针对 Twitter 数据的情感分析(或意见挖掘)引起了大量关注。该系统的一个关键特征,是以简单、用户友好且快速的方式与其他用户沟通的即时性。因此,人们倾向于自由表达感受,这使得 Twitter 成为积累针对广泛话题海量观点的理想来源。这些信息量提供了巨大潜力,可被利用来获取针对这些话题的情感倾向。然而,由于无人能投入无限时间阅读这些推文,自动决策方法是必要的。尽管如此,大多数现有解决方案仅限于集中式环境。因此,它们至多只能处理几千条推文。由于每日发布的推文数量巨大,这样的样本不足以代表性地定义针对某话题的情感极性。在本文中,我们更进一步,在 MapReduce 框架中开发了用于情感学习的新型方法。我们的算法利用推文中的标签和表情符号作为情感标签,并以并行分布式方式对多种情感类型进行分类。此外,我们利用 Bloom 过滤器压缩中间数据的存储大小并提升算法性能。通过广泛的实验评估,我们证明了我们的解决方案高效、鲁棒且可扩展,并确认了情感识别的质量。

关键词

引用

@article{arxiv.1602.01248,
  title  = {Using Hadoop for Large Scale Analysis on Twitter: A Technical Report},
  author = {Nikolaos Nodarakis and Spyros Sioutas and Athanasios Tsakalidis and Giannis Tzimas},
  journal= {arXiv preprint arXiv:1602.01248},
  year   = {2016}
}

备注

8 pages, 3 tables, 3 figures