城市交叉口的视觉推理:微调 GPT-4o 用于交通冲突检测
计算机视觉与模式识别
2025-03-03 v1 计算与语言
摘要
由于复杂性、频繁的冲突和盲点,无信号城市交叉口的交通控制面临重大挑战。本研究探索了利用多模态大语言模型(MLLMs),如 GPT-4o,通过直接使用四向交叉口的鸟瞰视频来提供逻辑和视觉推理的能力。在这种提出的方法中,GPT-4o 作为智能系统检测冲突,并为驾驶员提供解释和建议。微调后的模型达到了 77.14% 的准确率,而对微调后的 GPT-4o 的真实预测值的人工评估表明,模型生成的解释达到了 89.9% 的显著准确率,建议的下一步行动达到了 92.3% 的准确率。这些结果突显了使用 MLLMs 以视频作为输入进行实时交通管理的可行性,为交叉口交通管理和运营提供了可扩展且可操作的见解。本研究中使用的代码可在 https://github.com/sarimasri3/Traffic-Intersection-Conflict-Detection-using-images.git 获取。
引用
@article{arxiv.2502.20573,
title = {Visual Reasoning at Urban Intersections: FineTuning GPT-4o for Traffic Conflict Detection},
author = {Sari Masri and Huthaifa I. Ashqar and Mohammed Elhenawy},
journal= {arXiv preprint arXiv:2502.20573},
year = {2025}
}