中文

Neural Sentinel:面向人类在环持续学习的统一视觉语言模型许可证牌识别

计算机视觉与模式识别 2026-02-10 v1 人工智能 机器学习 神经与进化计算

摘要

传统自动许可证牌识别(ALPR)系统采用由目标检测网络后置的独立光学字符识别(OCR)模块组成的多阶段管道,引入累积错误、延迟增加和架构复杂性。本研究提出了Neural Sentinel,一种新颖的统一方法,利用视觉语言模型(VLM)通过单次前向传播执行许可证牌识别、车牌状态分类和车辆属性提取。我们的主要贡献在于证明,通过低秩适应(LoRA)微调的 PaliGemma 3B 模型可同时回答关于车辆图像的多个视觉问题,实现 92.3% 的车牌识别准确率,显著优于 EasyOCR 和 PaddleOCR 基准方法(分别提升 14.1% 和 9.9%)。我们引入的人类在环(HITL)持续学习框架在 incorporates 用户纠正,同时通过经验回放防止灾难性遗忘,保持 70:30 的原始训练数据与纠正样本比例。系统实现平均推理延迟为 152ms,预期校准误差(ECE)为 0.048,表明置信度估计已良好校准。此外,VLM 首架构使零样例 generalization 至附加任务成为可能,包括车辆颜色检测(89%)、座椅带检测(82%)和座位占用计数(78%),无需特定任务训练。通过在真实收费闸机图像上进行大规模实验,我们证明了统一视觉语言方法代表着 ALPR 系统的范式转变,提供卓越的准确率、降低的架构复杂性和无法通过传统管道方法实现的新兴多任务能力。

关键词

引用

@article{arxiv.2602.07051,
  title  = {Neural Sentinel: Unified Vision Language Model (VLM) for License Plate Recognition with Human-in-the-Loop Continual Learning},
  author = {Karthik Sivakoti},
  journal= {arXiv preprint arXiv:2602.07051},
  year   = {2026}
}