中文

LP-LLM:基于大型多模态模型的端到端真实场景退化车牌文本识别

计算机视觉与模式识别 2026-01-15 v1 人工智能

摘要

真实场景下的车牌识别面临运动模糊、低分辨率和复杂光照等严重退化带来的重大挑战。主流的“先恢复后识别”两阶段范式存在根本缺陷:图像恢复模型的像素级优化目标与字符识别的语义目标不一致,导致伪影干扰和误差累积。尽管视觉语言模型展示了强大的通用能力,但它们缺乏对车牌字符序列(如固定长度、特定顺序)的显式结构建模。针对此问题,我们提出了一种基于 Qwen3-VL 的端到端结构感知多模态推理框架。核心创新在于字符感知多模态推理模块(CMRM),该模块引入了一组可学习的字符槽位查询。通过交叉注意力机制,这些查询主动从视觉特征中检索与字符位置对应的细粒度证据。随后,我们通过残差调制将这些字符感知表示注入回视觉 token,使语言模型能够基于显式结构先验进行自回归生成。此外,结合 LoRA 参数高效微调策略,模型在实现领域适应的同时保留了大模型的泛化能力。在合成和真实场景的严重退化数据集上的大量实验表明,我们的方法显著优于现有的恢复-识别组合方法和通用 VLM,验证了将结构化推理引入大模型以处理低质量文本识别任务的优越性。

关键词

引用

@article{arxiv.2601.09116,
  title  = {LP-LLM: End-to-End Real-World Degraded License Plate Text Recognition via Large Multimodal Models},
  author = {Haoyan Gong and Hongbin Liu},
  journal= {arXiv preprint arXiv:2601.09116},
  year   = {2026}
}