中文

推进车牌识别:基于VehiclePaliGemma的多任务视觉语言模型

计算机视觉与模式识别 2024-12-20 v1 机器学习

摘要

车牌识别(LPR)涉及利用摄像机和计算机视觉读取车辆牌照的自动化系统。通过LPR收集的此类车牌随后可以与数据库进行比对,以识别被盗车辆、无保险驾驶员、犯罪嫌疑人等。LPR系统在为警察等机构节省时间方面发挥着重要作用。过去,LPR严重依赖光学字符识别(OCR),该技术已被广泛探索用于识别图像中的字符。通常,收集到的车牌图像存在各种限制,包括噪声、模糊、天气条件和字符间距过近,使得识别变得复杂。现有的LPR方法仍需大幅改进,特别是对于失真图像。为了填补这一空白,我们提出利用视觉语言模型,如OpenAI GPT4o、Google Gemini 1.5、Google PaliGemma(Pathways Language and Image model + Gemma model)、Meta Llama 3.2、Anthropic Claude 3.5 Sonnet、LLaVA、NVIDIA VILA和moondream2来识别此类字符间距过近的不清晰车牌。本文评估了VLM解决上述问题的能力。此外,我们引入了“VehiclePaliGemma”,这是一个经过微调的开源PaliGemma VLM,旨在识别挑战性条件下的车牌。我们使用在复杂条件下收集的马来西亚车牌数据集,将我们提出的VehiclePaliGemma与现有方法及其他VLM进行了比较。结果表明,VehiclePaliGemma取得了优异的性能,准确率达到87.6%。此外,使用A100-80GB GPU,它能够以每秒7帧的速度预测汽车车牌。最后,我们探索了VehiclePaliGemma模型的多任务能力,以准确识别包含不同型号和颜色的多辆汽车、且车牌朝不同方向放置和定向的车牌。

关键词

引用

@article{arxiv.2412.14197,
  title  = {Advancing Vehicle Plate Recognition: Multitasking Visual Language Models with VehiclePaliGemma},
  author = {Nouar AlDahoul and Myles Joshua Toledo Tan and Raghava Reddy Tera and Hezerul Abdul Karim and Chee How Lim and Manish Kumar Mishra and Yasir Zaki},
  journal= {arXiv preprint arXiv:2412.14197},
  year   = {2024}
}

备注

33 pages, 9 figures