中文

结合高效参数微调与 Transformer 的混合文本识别

计算机视觉与模式识别 2025-05-12 v4

摘要

随着 OCR 技术的快速发展,混合场景文本识别已成为一项关键的技术挑战。尽管深度学习模型在特定场景中取得了显著成果,但其通用性和稳定性仍有待提高,且对计算资源的高需求影响了灵活性。为了解决这些问题,本文提出了一种基于预训练 OCR Transformer 的参数高效混合文本识别方法 DLoRA-TrOCR。通过在图像编码器中嵌入权重分解的 DoRA 模块,并在文本解码器中嵌入 LoRA 模块,该方法能够在各种下游任务中进行高效微调。该方法所需的可训练参数不超过 0.7\%,不仅提高了训练效率,还显著提升了 OCR 系统在混合文本场景中的识别准确率和跨数据集泛化性能。实验表明,我们提出的 DLoRA-TrOCR 在识别包含手写、打印和街景文本的复杂混合场景时优于其他参数高效微调方法,在 IAM 数据集上实现了 4.02 的 CER,在 SROIE 数据集上实现了 94.29 的 F1 分数,在 STR Benchmark 上实现了 86.70 的 WAR,达到了 SOTA 性能。

关键词

引用

@article{arxiv.2404.12734,
  title  = {Mixed Text Recognition with Efficient Parameter Fine-Tuning and Transformer},
  author = {Da Chang and Yu Li},
  journal= {arXiv preprint arXiv:2404.12734},
  year   = {2025}
}