中文

危机后 Twitter 数据采集流水线

信息检索 2018-01-19 v1

摘要

由于 Twitter 等社交媒体平台上数据的即时可用性,以及机器学习与数据管理技术的进步,实时危机信息学在过去十年中已成为一个多产的研究领域。尽管现已存在若干基准数据集,特别是在 CrisisLex 等门户上,但一个迄今尚未解决的重要实际问题是:如何从 Twitter API 等免费公开流中快速获取并基准化数据。在本文中,我们展示了一个用于从 Twitter API 促进危机后即时数据收集、整理和相关性过滤的流水线正在进行的工作。该流水线为最小监督式,通过审慎结合数据预处理与快速文本嵌入以及主动学习框架,减轻特征工程的需求。我们通过描述一个近期案例研究来说明该流水线的效用,其中它被用于在拉斯维加斯枪击事件后立即收集并分析数百万条推文。

关键词

引用

@article{arxiv.1801.05881,
  title  = {A Pipeline for Post-Crisis Twitter Data Acquisition},
  author = {Mayank Kejriwal and Yao Gu},
  journal= {arXiv preprint arXiv:1801.05881},
  year   = {2018}
}

备注

6 pages, 4 figures, Workshop on Social Web in Emergency and Disaster Management 2018 at the ACM WSDM Conference