使用机器学习与深度学习识别潜在误分类的碰撞叙述
计算与语言
2025-07-08 v1 人工智能
摘要
本研究探讨了机器学习与深度学习方法在检测警方报告叙述中误分类的交叉口相关碰撞方面的有效性。利用爱荷华州交通部2019年的碰撞数据,我们实施并比较了一套全面的模型,包括支持向量机、XGBoost、BERT句子嵌入、BERT词嵌入和Albert模型。模型性能通过专家对潜在误分类叙述的审查进行了系统验证,提供了对分类准确性的严格评估。结果表明,尽管传统机器学习方法在整体性能上优于某些深度学习方法,但Albert模型与专家分类的一致性最高(与专家1的一致性为73%),与原始表格数据的一致性为58%。统计分析显示,Albert模型保持了与专家间一致性率相似的性能水平,显著优于其他方法,尤其是在模糊叙述上。这项工作通过多模态集成分析解决了交通安全研究中的一个关键空白,通过结合叙述文本与结构化碰撞数据,将错误率降低了54.2%。我们得出结论,将自动分类与有针对性的专家审查相结合的混合方法为改善碰撞数据质量提供了一种实用方法,对交通安全管理和政策制定具有重要影响。
引用
@article{arxiv.2507.03066,
title = {Identification of Potentially Misclassified Crash Narratives using Machine Learning (ML) and Deep Learning (DL)},
author = {Sudesh Bhagat and Ibne Farabi Shihab and Jonathan Wood},
journal= {arXiv preprint arXiv:2507.03066},
year = {2025}
}