基于频繁模式树的实时交通事故风险预测
应用统计
2017-11-01 v2 机器学习
摘要
交通事故数据通常含有噪声、缺失值且异构。如何选择最重要的变量以改进实时交通事故风险预测已成为近期许多研究的关注点。本文提出一种基于频繁模式树(FP tree)算法的新型变量选择方法。首先,发现交通事故数据集中的所有频繁模式。然后,针对每个频繁模式,计算我们提出的新准则——相对对象纯度比(Relative Object Purity Ratio, ROPR)。将该ROPR加到区分此频繁模式与其他模式的变量的重要性得分上。为测试所提方法,构建了一个数据集,其来源于2005年弗吉尼亚州州际公路I-64上仅由单一检测器检测到的交通事故记录。该数据集随后与实时交通信息和天气条件等其他变量关联。基于FP树算法的所提方法以及广泛使用的随机森林方法均被用于识别弗吉尼亚数据集的重要变量。结果表明,FP树认为重要的变量与随机森林方法选择的变量存在一些差异。随后,开发了两种基线模型(即最近邻(k-NN)方法和贝叶斯网络),基于FP树方法和随机森林方法识别的变量来预测事故风险。结果显示,对于多个版本的k-NN和贝叶斯网络模型,使用FP树变量选择的模型表现优于基于随机森林方法的模型。最佳结果来自使用FP树变量的贝叶斯网络模型。该模型能准确预测61.11%的事故,误报率为38.16%。
引用
@article{arxiv.1701.05691,
title = {Real-time Traffic Accident Risk Prediction based on Frequent Pattern Tree},
author = {Lei Lin and Qian Wang and Adel W. Sadek},
journal= {arXiv preprint arXiv:1701.05691},
year = {2017}
}
备注
OPT-i 2014 - 1st International Conference on Engineering and Applied Sciences Optimization, Proceedings