基于机器学习与数据挖掘的丹佛市犯罪比较研究
机器学习
2020-01-10 v1 计算机与社会
机器学习
摘要
为保障大众安全,犯罪预防是任何政府最优先的事项之一。准确的犯罪预测模型可帮助政府与执法部门预防暴力、提前侦测罪犯、分配政府资源并识别致罪问题。为构建任何面向未来的工具,尽早审视并理解犯罪模式至关重要。本文分析了美国丹佛县2014年1月至2019年5月的真实世界犯罪与事故数据集,包含478,578起事件。本项目旨在预测并凸显发生趋势,进而支持执法机构与政府从预测率中发现预防措施。首先,我应用了若干由多种数据可视化方法支撑的统计分析。随后,我实现了多种分类算法,如随机森林(Random Forest)、决策树(Decision Tree)、AdaBoost分类器、Extra Tree分类器、线性判别分析(Linear Discriminant Analysis)、K近邻分类器(K-Neighbors Classifiers)以及4个集成模型(Ensemble Models),以分类15类不同犯罪。结果采用两种流行测试方法捕获:训练-测试划分与k折交叉验证。此外,为完美评估性能,我还使用了精确率、召回率、F1分数、均方误差(MSE)、ROC曲线与配对T检验。除AdaBoost分类器外,多数算法表现出令人满意的准确率。随机森林、决策树、集成模型1、3与4甚至为我产出超过90%的准确率。在所有方法中,集成模型4在各项评估基准上均呈现最优结果。本研究可有助于提高民众对发生地点的警觉,并协助安全机构预测特定区域在特定时间内的暴力未来爆发。
引用
@article{arxiv.2001.02802,
title = {A Comparative Study on Crime in Denver City Based on Machine Learning and Data Mining},
author = {Md. Aminur Rab Ratul},
journal= {arXiv preprint arXiv:2001.02802},
year = {2020}
}