野外基于视频的车辆监控:使用自反思视觉语言模型进行车牌、车型和车身颜色识别
计算机视觉与模式识别
2025-08-05 v1 人工智能
摘要
自动车牌识别(ALPR)和车辆车型识别是智能交通系统的基础,支持执法、收费和事后调查等工作。将这些方法应用于手持智能手机或非固定车载摄像头捕获的视频 presents 独特的挑战,包括频繁的摄像机运动、视角变化、遮挡以及未知的道路几何。传统的ALPR解决方案依赖专业硬件和手工制作的OCR流程,在这些条件下往往性能下降。近期大型视觉语言模型(Vision-Language Model, VLM)的进展使能够直接从任意图像中识别文本和语义属性。本研究评估了使用手持智能手机和非固定车载摄像头捕获的单目视频应用VLMs进行ALPR和车型识别的潜力。我们提出的车牌识别管道筛选清晰帧,然后通过多种提示策略将多模态提示发送给VLM。车型识别管道使用修订后的提示和可选的自反思模块运行相同的VLM。在自反思模块中,模型将查询图像与来自 134 类数据集的参考图像进行对比,以纠正不匹配。在由德州大学阿斯顿分校收集的智能手机数据集上,实验实现了ALPR 和车型识别的 Top-1 准确率分别为 91.67% 和 66.67%。在公共数据集 UFPR-ALPR 上,方法实现了 83.05% 和 61.07%。自反思模块在车型识别上平均提高了 5.72%。这些发现表明,VLMs 为可扩展的、动态交通视频分析提供了成本效益高的解决方案。
引用
@article{arxiv.2508.01387,
title = {Video-based Vehicle Surveillance in the Wild: License Plate, Make, and Model Recognition with Self Reflective Vision-Language Models},
author = {Pouya Parsa and Keya Li and Kara M. Kockelman and Seongjin Choi},
journal= {arXiv preprint arXiv:2508.01387},
year = {2025}
}
备注
19 pages, 6 figures, 4 tables