中文

低资源语言的手写文本识别

计算机视觉与模式识别 2025-12-02 v1

摘要

尽管手写文本识别已取得显著进展,但段落级手写文本识别,特别是在印地语、乌尔都语等低资源语言中,仍然是一个具有挑战性的问题。这些语言通常缺乏全面的语言资源,需要特别关注以开发鲁棒的准确光学字符识别(OCR)系统。本文介绍了 BharatOCR,一种新颖的无分割段落级手写印地语和乌尔都语文本识别。我们提出了一种 ViT-Transformer 解码器-语言模型架构用于手写文本识别,其中 Vision Transformer(ViT)提取视觉特征,Transformer 解码器生成文本序列,预训练语言模型(LM)优化输出以提高准确性、流利性和连贯性。我们的模型利用研究中提出的用于掩码图像建模的 Data-efficient Image Transformer(DeiT)模型。此外,我们采用针对掩码语言建模(MLM)优化的 RoBERTa 架构以增强所提出模型的语言理解和生成能力。Transformer 解码器从视觉嵌入中生成文本序列。该模型设计为逐行迭代处理段落图像,称为隐式行分割。所提出的模型使用我们自定义的数据集('Parimal Urdu' 和 'Parimal Hindi')以及两个公开数据集进行了评估。所提出的模型在 NUST-UHWR、PUCIT-OUHL 和 Parimal-Urdu 数据集上取得了基准结果,字符识别率分别为 96.24%、92.05% 和 94.80%。该模型在使用印地语数据集时也取得了基准结果,字符识别率为 80.64%。所提出模型的结果表明,它优于多种最先进的乌尔都语文本识别方法。

关键词

引用

@article{arxiv.2512.01348,
  title  = {Handwritten Text Recognition for Low Resource Languages},
  author = {Sayantan Dey and Alireza Alaei and Partha Pratim Roy},
  journal= {arXiv preprint arXiv:2512.01348},
  year   = {2025}
}

备注

21 Pages