中文

通过事故特征选择预测和解释交通事故严重程度

机器学习 2025-08-18 v1 计算机与社会

摘要

motor vehicle crashes 仍是全球造成伤残和死亡的主要原因,迫切需要数据驱动的方法来理解和缓解事故严重程度。本研究引入了一个包含超过 300 万起事故中涉及人员的精选数据集,覆盖 2017-2022 年六年,聚合为超过 230 万辆车级别的记录,用于预测分析。本文的主要贡献是一种透明且可复现的方法,将自动机器学习 (AutoML) 和可解释人工智能 (AI) 结合起来,以识别和解释与严重事故相关的关键风险因素。使用 JADBio AutoML 平台构建了预测模型,以区分严重与非严重事故结果。模型在分层训练子集上进行严格的特征选择,并使用 SHapley Additive exPlanations (SHAP) 解释其输出,以量化单个特征的贡献。最终的 Ridge Logistic 回归模型在训练集上获得 AUC-ROC 为 85.6%,在留置测试集上为 84.9%,且 17 个特征持续被识别为最具影响力的预测因子。关键特征涵盖人口统计、环境、车辆、人类和操作类别,包括地点类型、限速、最低乘客年龄和事发前行动。值得注意的是,某些通常被强调的因素,如酒精或药物影响,在最终模型中并不具备主要影响力,取而代之的是环境和情境变量。强调方法论的严谨性和可解释性,而非仅仅追求预测性能,本研究提供了一个可扩展的框架,以支持与 Vision Zero 相匹配的干预措施和数据驱动的交通安全政策。

关键词

引用

@article{arxiv.2508.11504,
  title  = {Predicting and Explaining Traffic Crash Severity Through Crash Feature Selection},
  author = {Andrea Castellani and Zacharias Papadovasilakis and Giorgos Papoutsoglou and Mary Cole and Brian Bautsch and Tobias Rodemann and Ioannis Tsamardinos and Angela Harden},
  journal= {arXiv preprint arXiv:2508.11504},
  year   = {2025}
}

备注

Preprint. Manuscript under review at "Accident Analysis & Prevention" journal