中文

基于多模态大语言模型的事故数据集生成全自动化系统设计与应用

计算与语言 2025-10-03 v2

摘要

道路交通事故仍是发展中国家如孟加拉国面临的重大公共安全和社会经济问题。现有的事故数据收集主要依赖手动、碎片化且不可靠的方式,导致数据缺失报告和记录不一致。本研究提出了一个完全自动化的系统,利用大语言模型(LLM)和网页抓取技术来应对上述挑战。该管道由四个组成部分构成:自动化网页抓取代码生成、来自线上来源的新闻收集、事故新闻分类与结构化数据提取,以及去重。该系统使用多模态生成式大语言模型 Gemini-2.0-Flash 实现无缝自动化。代码生成模块将网页分类为分页、动态或无限滚动类别,并生成适合的 Python 脚本进行抓取。LLM 还对事故关键信息进行分类和提取,包括日期、时间、地点、死亡人数、受伤人数、道路类型、车辆类型以及行人参与情况。去重算法通过删除重复报告确保数据完整性。该系统在 111 天内(2024 年 10 月 1 日至 2025 年 1 月 20 日)抓取了 14 个主要孟加拉国新闻网站,处理超过 15,000 篇新闻文章,识别出 705 起唯一事故。代码生成模块实现了 91.3% 的校准率和 80% 的验证准确率。Chittagong 报告了最多的事故(80 起)、死亡人数(70 人)和受伤人数(115 人),随后分别是 Dhaka、Faridpur、Gazipur 和 Cox's Bazar。事故的高峰时间为上午(8-9 点)、中午(12-1 点)和晚上(6-7 点)。我们还开发了一个公开仓库,包含使用说明。本研究表明,LLM 驱动的、可扩展的系统能够实现准确、低 effort 的事故数据收集,为孟加拉国的数据驱动道路安全政策制定奠定了基础。

关键词

引用

@article{arxiv.2505.00015,
  title  = {Design and Application of Multimodal Large Language Model Based System for End to End Automation of Accident Dataset Generation},
  author = {MD Thamed Bin Zaman Chowdhury and Moazzem Hossain},
  journal= {arXiv preprint arXiv:2505.00015},
  year   = {2025}
}

备注

This paper is accepted for presentation in TRB annual meeting 2026. The version presented here is the preprint version before peer review process