中文

基于YOLO和视觉-语言OCR的鲁棒孟加拉语车牌识别深度学习框架

计算机视觉与模式识别 2026-05-26 v2

摘要

自动车牌识别(ALPR)系统是智能交通管理系统中的关键组成部分。然而,由于复杂的字符方案和不均匀的布局,孟加拉语车牌的检测仍然具有挑战性。本文提出了一种鲁棒的孟加拉语车牌识别系统,该系统将基于深度学习的车牌定位目标检测模型与用于文本提取的光学字符识别(OCR)相结合。我们比较了多种目标检测架构,包括U-Net和几种YOLO(You Only Look Once)变体,用于车牌定位。本研究提出了一种基于YOLOv8架构的新型两阶段自适应训练策略,以提高定位性能。所提出的方法优于现有模型,达到了97.83%的准确率和91.3%的交并比(IoU)。文本识别问题被表述为一个使用视觉编码器-解码器(VisionEncoderDecoder)架构的序列生成问题,并对多种编码器-解码器组合进行了评估。结果表明,ViT + BanglaBERT模型在字符级别上表现更好,字符错误率为0.1323,词错误率为0.1068。所提出的系统在为本研究目的而整理的外部数据集上进行测试时,也表现出一致的性能。该数据集提供了与训练样本完全不同的环境和光照条件,表明了所提出框架的鲁棒性。总体而言,我们提出的系统为孟加拉语车牌识别提供了一个鲁棒且可靠的解决方案,并在各种真实世界场景(包括光照、噪声和车牌样式的变化)中有效运行。这些优势使其非常适合部署在智能交通应用中,例如自动执法和访问控制。

关键词

引用

@article{arxiv.2603.10267,
  title  = {A Robust Deep Learning Framework for Bangla License Plate Recognition Using YOLO and Vision-Language OCR},
  author = {Nayeb Hasin and Md. Arafath Rahman Nishat and Mainul Islam and Khandakar Shakib Al Hasan and Asif Newaz},
  journal= {arXiv preprint arXiv:2603.10267},
  year   = {2026}
}

备注

Accepted at the 2026 IEEE International Conference on AI and Data Analytics (ICAD 2026). Final version will appear in IEEE Xplore