中文

使用坡度方法预测人员级伤势:结合道路分类与自然语言处理技术的平衡方法

机器学习 2025-09-10 v1

摘要

预测交通事故中的伤势和死亡人数在提高道路安全、改进紧急响应和指导公共卫生干预方面发挥着关键作用。本研究探讨了将非结构化事故叙述(警察现场撰写)与结构化事故数据结合用于预测伤势的增值作用。两种广泛使用的自然语言处理(NLP)技术,即术语频率-逆文档频率(TF-IDF)和 Word2Vec,用于从叙述中提取语义含义,并进行比较。为解决类别不平衡问题,采用基于 K-最近邻的过采样方法用于训练数据。数据集由 2019-2023 年肯塔基州的事故记录组成。为 account for 道路异质性,使用了三种道路分类方案:(1)八个详细功能类别(如城市双车道、农村高速公路、城市多车道分隔道路),(2)四个更宽泛的配对类别(如城市 vs. 农村、高速公路 vs. 非高速公路),(3)不采用分类的统一数据集。开发了总计 102 个机器学习模型,通过将结构化特征和叙述基方法的特征结合起来,使用两种 NLP 技术以及三种集成算法:XGBoost、随机森林和 AdaBoost。结果表明,包含叙述数据的数据模型在预测准确性上一致优于仅依赖结构化数据的数据模型。在所有组合中,TF-IDF 与 XGBoost 组合在大多数子组中产生最准确的预测。该研究凸显了将文本和结构化事故信息集成以增强人员级伤势预测的潜力。这项工作为交通安全专业人员提供了一个实用且可适应的框架,以改进伤势建模、指导政策决策并设计更有效的对策。

关键词

引用

@article{arxiv.2509.07845,
  title  = {Predicting person-level injury severity using crash narratives: A balanced approach with roadway classification and natural language process techniques},
  author = {Mohammad Zana Majidi and Sajjad Karimi and Teng Wang and Robert Kluger and Reginald Souleyrette},
  journal= {arXiv preprint arXiv:2509.07845},
  year   = {2025}
}