预测在线极端主义、内容采纳者与互动互惠性
社会与信息网络
2017-03-07 v1 机器学习
物理与社会
摘要
我们提出了一个机器学习框架,利用元数据、网络和时序特征的混合来检测极端主义用户,并预测社交媒体中的内容采纳者与互动互惠性。我们利用了一个独特的数据集,其中包含超过 2.5 万名用户生成的数百万条推文,这些用户因参与极端主义活动而被 Twitter 手动识别、举报并封禁。我们还利用了由 2.5 万名随机抽样的普通用户生成的数百万条推文,这些用户曾接触或消费过极端主义内容。我们执行了三项预测任务:(i) 检测极端主义用户,(ii) 估计普通用户是否会采纳极端主义内容,以及 (iii) 预测用户是否会互惠由极端主义者发起的联系。所有预测任务均设置在两种情景中:基于聚合数据的事后(时间无关)预测任务,以及模拟实时预测任务。我们的框架表现极为可观,在不同预测情景中,极端主义用户检测的 AUC 最高达 93%,内容采纳预测的 AUC 最高达 80%,互动互惠性预测的 AUC 最高达 72%。最后我们给出了详尽的特征分析,有助于确定在不同情景中提供预测能力的涌现信号。
引用
@article{arxiv.1605.00659,
title = {Predicting online extremism, content adopters, and interaction reciprocity},
author = {Emilio Ferrara and Wen-Qiang Wang and Onur Varol and Alessandro Flammini and Aram Galstyan},
journal= {arXiv preprint arXiv:1605.00659},
year = {2017}
}
备注
9 pages, 3 figures, 8 tables