中文

利用本地化新闻数据预测美国的恐怖袭击

机器学习 2022-10-12 v2

摘要

恐怖主义是全球范围内的重大问题,每年造成数千人死亡和数十亿美元损失。为了更好地理解和缓解这些袭击,我们提出了一组从本地化新闻数据中学习的机器学习模型,用以预测在给定日历日期和给定州是否会发生恐怖袭击。最佳模型——一种从特征空间的新变量长度移动平均表示中学习的随机森林(Random Forest)——在2015至2018年间受恐怖主义影响最严重的五个州中的四个上取得了受试者工作特征曲线下面积得分 >.667> .667。我们的关键发现包括:将恐怖主义建模为一组独立事件而非连续过程是一种富有成效的方法——尤其在事件稀疏且不相似时。此外,我们的结果凸显了考虑地区差异的本地化模型的必要性。从机器学习角度看,我们发现随机森林模型在我们的多模态、噪声且不平衡的数据集上优于若干深度模型,从而证明了我们的新特征表示方法在此类情境下的有效性。我们还表明其预测对袭击间的时间间隔和袭击的观测特征相对稳健。最后,我们分析了限制模型性能的因素,包括噪声特征空间和可用数据量少。这些贡献为在美国及更广泛范围内利用机器学习开展反恐工作提供了重要基础。

关键词

引用

@article{arxiv.2201.04292,
  title  = {Predicting Terrorist Attacks in the United States using Localized News Data},
  author = {Steven J. Krieg and Christian W. Smith and Rusha Chatterjee and Nitesh V. Chawla},
  journal= {arXiv preprint arXiv:2201.04292},
  year   = {2022}
}