中文

将交通事故学习为语言:数据集、基准和假设因果分析

计算机视觉与模式识别 2024-06-18 v1

摘要

全球范围内不断上升的道路交通事故率不仅导致重大的生命损失,还给社会带来数十亿美元的财政负担。当前交通事故频率建模与分析的研究主要将该问题视为分类任务,侧重于基于学习的分类或集成学习方法。这些方法常常忽视了与交通事故和风险情况相关的复杂基础设施、环境、人为和情境因素之间的错综复杂关系。相比之下,我们首先提出了一个大规模交通事故语言数据集,名为CrashEvent,总结了19,340份真实世界的事故报告,并整合了华盛顿州的基础设施数据、环境和交通文本及视觉信息。利用这个丰富的数据集,我们进一步将事故事件特征学习表述为一个新颖的文本推理问题,并进一步微调各种大语言模型(LLM),以基于情境和环境因素预测详细的事故结果,例如事故类型、严重程度和受伤人数。所提出的模型CrashLLM与现有解决方案不同,它利用LLM固有的文本推理能力来解析和学习复杂的非结构化数据,从而能够对影响因素进行更细致的分析。我们的实验结果表明,我们基于LLM的方法不仅预测了事故的严重程度,还分类了不同类型的事故并预测了受伤结果,所有平均F1分数从34.9%提升到了53.8%。此外,CrashLLM可以利用学习到的推理特征,为许多开放世界中的假设情境感知交通安全分析提供有价值的见解,这是现有模型无法提供的。我们公开了我们的基准、数据集和模型,以供进一步探索。

关键词

引用

@article{arxiv.2406.10789,
  title  = {Learning Traffic Crashes as Language: Datasets, Benchmarks, and What-if Causal Analyses},
  author = {Zhiwen Fan and Pu Wang and Yang Zhao and Yibo Zhao and Boris Ivanovic and Zhangyang Wang and Marco Pavone and Hao Frank Yang},
  journal= {arXiv preprint arXiv:2406.10789},
  year   = {2024}
}