基于词元与聚合起讫点信息的推特数据探索性数据分析Python库
计算与语言
2021-11-25 v3
摘要
Twitter或许是更适于研究的社交媒体。获取信息仅需几步,且有大量库可助此功。然而,知晓特定事件是否在Twitter上被表达是一项具有挑战性的任务,需要相当规模的推文收集。本提议旨在通过开放一个自2015年12月以来取自Twitter的已处理信息集合,为感兴趣的研究者便利其在Twitter上挖掘事件的过程。这些事件可关联自然灾害、健康问题与人员流动等,亦可借助所提议库开展其他研究。本文给出不同应用以展示库的能力:推文中发现话题的探索性分析、西班牙语方言间相似性研究,以及不同国家流动报告。总之,所呈Python库应用于不同领域,并依日检索阿拉伯语、英语、西班牙语与俄语的词汇及双词词频信息之大量结果。以及关联逾200个国家或地区间出行次数的流动信息。
引用
@article{arxiv.2009.01826,
title = {A Python Library for Exploratory Data Analysis on Twitter Data based on Tokens and Aggregated Origin-Destination Information},
author = {Mario Graff and Daniela Moctezuma and Sabino Miranda-Jiménez and Eric S. Tellez},
journal= {arXiv preprint arXiv:2009.01826},
year = {2021}
}