利用实例分割辅助的多模态大语言模型进行智能交通监控
人工智能
2026-01-23 v1 计算与语言
计算机视觉与模式识别
摘要
鲁棒且高效的交通监控系统对于智慧城市和智能交通系统(ITS)至关重要,其利用传感器和摄像头来追踪车辆运动、优化交通流、减少拥堵、增强道路安全并实现实时自适应交通控制。交通监控模型必须全面理解动态城市条件,并提供直观的管理界面。本研究利用 LLaVA 视觉定位多模态大语言模型(LLM),在 Quanser Interactive Lab 实时仿真平台上执行交通监控任务,覆盖交叉路口、拥堵和碰撞等场景。部署在多个城市位置的摄像头采集仿真实时图像,并输入 LLaVA 模型进行分析。集成到摄像头中的实例分割模型高亮显示车辆和行人等关键要素,从而提升训练效果和吞吐量。该系统在识别车辆位置方面达到 84.3% 的准确率,在确定转向方向方面达到 76.4% 的准确率,优于传统模型。
引用
@article{arxiv.2502.11304,
title = {Leveraging Multimodal-LLMs Assisted by Instance Segmentation for Intelligent Traffic Monitoring},
author = {Murat Arda Onsu and Poonam Lohan and Burak Kantarci and Aisha Syed and Matthew Andrews and Sean Kennedy},
journal= {arXiv preprint arXiv:2502.11304},
year = {2026}
}
备注
6 pages, 7 figures, submitted to 30th IEEE International Symposium on Computers and Communications (ISCC) 2025