中文

面向韩文字符识别的轻量级多模块融合方法

计算机视觉与模式识别 2025-04-09 v1 人工智能

摘要

光学字符识别(OCR)是文档处理、车牌识别和智能监控等应用中的关键技术。然而,现有OCR模型常因文本布局不规则、图像质量差、字符 variability 以及高计算成本在实际场景中表现不佳。本文引入SDA-Net(Stroke-Sensitive Attention and Dynamic Context Encoding Network),这是一种轻量级且高效的体系结构,专为稳健的单字符识别设计。SDA-Net集成了:(1)双注意力机制以增强笔画级别和空间特征提取;(2)动态上下文编码模块通过可学习的门控机制自适应地细化语义信息;(3)受U-Net启发的特征融合策略用于组合低级和高级特征;以及(4)高度优化的轻量级主干网络,以减少内存和计算需求。实验结果表明,SDA-Net在挑战性OCR基准数据集上实现了最先进的准确率,推理速度显著提升,适用于实时和边缘部署的OCR系统。

关键词

引用

@article{arxiv.2504.05770,
  title  = {A Lightweight Multi-Module Fusion Approach for Korean Character Recognition},
  author = {Inho Jake Park and Jaehoon Jay Jeong and Ho-Sang Jo},
  journal= {arXiv preprint arXiv:2504.05770},
  year   = {2025}
}

备注

12 pages, 5 figures, 5 tables