Durghotona GPT:基于网页抓取和大语言模型的框架,用于自动生成孟加拉国道路事故数据集
计算与语言
2025-06-12 v1
摘要
道路事故在全球范围内构成重大关切。它们导致巨额财产损失、伤害、残疾以及社会挑战。准确和及时的数据对于预测和缓解这些事件至关重要。本文提出了名为“Durghotona GPT”的新框架,将网页抓取和大语言模型(LLM)集成,以自动从孟加拉国主要报纸中生成全面的事故数据集。作者从三家主要报纸收集事故报告:Prothom Alo、Dhaka Tribune 和 The Daily Star。随后使用最新可用的 LLM 处理这些新闻:GPT-4、GPT-3.5 和 Llama-3。该框架高效提取相关信息、分类报告并编译详细数据集。因此,该框架克服了手动数据收集方法的局限性,如延迟、错误和沟通不畅。作者的评估显示,Llama-3 这一开源模型在准确率上与 GPT-4 相当,达到了 89%。因此,它可以被视为类似任务的具成本效益的替代方案。结果表明,作者开发的框架可以大幅提升事故数据的质量和可用性,从而支持交通安全分析、城市规划和公共卫生等关键应用。作者还为“Durghotona GPT”开发了一个界面,以便于使用。未来工作将聚焦于扩展数据收集方法并细化 LLM,以进一步提高数据集的准确率和适用性。
引用
@article{arxiv.2504.21025,
title = {Durghotona GPT: A Web Scraping and Large Language Model Based Framework to Generate Road Accident Dataset Automatically in Bangladesh},
author = {MD Thamed Bin Zaman Chowdhury and Moazzem Hossain and Md. Ridwanul Islam},
journal= {arXiv preprint arXiv:2504.21025},
year = {2025}
}
备注
It has been accepted in IEEE 27th International Conference on Computer and Information Technology (ICCIT). Now, we are waiting for it to get published in IEEE Xplore