ALIGN:基于几何空间神经推理的高精度事故定位视觉语言框架
人工智能
2026-05-19 v3
摘要
在中低收入国家,公共安全和城市规划项目常面临准确、地点特定的道路崩溃数据严重短缺。从非结构化文本中提取可靠的地理空间信息面临传统基于文本的地理编码工具的局限性,这些工具在多语言环境中处理模糊地点描述时常常失败。本研究引入ALIGN(Accident Location Inference through Geo-Spatial Neural Reasoning),一种旨在模拟人类空间推理以从非结构化孟加拉新闻报道和地图线索中推断精确事故坐标的视觉语言框架。开发了一系列自动化管道以处理多样化的文本和视觉数据,将大型语言模型用于线索提取与视觉语言模型用于地图验证。通过一种智能体架构,我们建模了一个迭代推理循环,将光学字符识别(OCR)、基于网格的空间扫描和3运行几何投票方法相结合,以数学方式隔离并减少视觉幻觉。研究结果表明,多模态ALIGN框架显然优于传统仅文本地理解析基准。例如,所提出的系统成功地将平均定位误差从不可用的10.915公里降低到亚公里精度的0.593公里。进一步测试该框架针对官方达卡大都会警察记录,确认了其可靠性,实现了平均误差为0.465公里。结果为数据稀缺地区的自动化事故映射提供了高精度、无需训练的基础,支持以证据为依据的道路安全政策制定,并推动了交通分析中多模态AI的集成。
引用
@article{arxiv.2511.06316,
title = {ALIGN: A Vision-Language Framework for High-Accuracy Accident Location Inference through Geo-Spatial Neural Reasoning},
author = {MD Thamed Bin Zaman Chowdhury and Moazzem Hossain},
journal= {arXiv preprint arXiv:2511.06316},
year = {2026}
}