中文

Twitter中的事件检测:一种关键词量方法

社会与信息网络 2019-01-04 v1 计算与语言 机器学习

摘要

利用社交媒体流进行事件检测需要一组具有强信号、极少预处理且与关注事件高度相关的信息性特征。从Twitter中将这些信息性特征识别为关键词颇具挑战,因为人们使用非正式语言表达思想与感受。这种非正式性包括缩写、错词、同义词、音译和歧义术语。本文提出一种高效方法,以筛选Twitter中频繁使用且与抗议等关注事件最相关的关键词。实时追踪这些关键词的量,以二分类方案识别关注事件。我们利用词对内的关键词捕捉上下文。所提方法通过对每个词对的每日计数向量应用尖峰检测时间滤波器进行二值化,随后使用 Jaccard 度量评估每个词对的二值向量与描述事件发生的二值向量之相似度。取前 n 个词对作为特征,将任意一天分类为事件日或非事件日。所选特征使用多种分类器测试,如朴素贝叶斯、SVM、逻辑回归、KNN 与决策树。它们均取得最高 0.91 的 AUC ROC 分数与最高 0.79 的 F1 分数。实验采用英语在墨尔本、悉尼、布里斯班等多城市以及印尼语在雅加达进行。两项涵盖不同语言与地点的实验得出相似结果。

关键词

引用

@article{arxiv.1901.00570,
  title  = {Event detection in Twitter: A keyword volume approach},
  author = {Ahmad Hany Hossny and Lewis Mitchell},
  journal= {arXiv preprint arXiv:1901.00570},
  year   = {2019}
}

备注

In: Proceedings of the 2nd International Workshop on Social Computing (IWSC '18): Spatial Social Behavior Analytics in Urban Society