基于 Permuted Autoregressive 方法的 Urdu 数字文本词级识别
计算机视觉与模式识别
2024-09-02 v3 人工智能
摘要
本研究论文介绍了一种 novel Urdu 数字文本的词级光学字符识别 (OCR) 模型,专为 Urdu 手写体设计,采用基于 transformer 的架构和注意力机制,以解决 Urdu 手写体识别中所特有的挑战,包括其多样化的文本样式、字体和变体。该模型采用 Permuted Autoregressive Sequence (PARSeq) 架构,通过对多个 token 排列进行训练,实现上下文感知的推断和迭代细化,从而增强其性能。该方法使模型能够灵活处理 Urdu 手写体中常见的字符重排和重叠字符。该模型在约由 160,000 张 Urdu 文本图像组成的数据集上进行训练,能够以 CER 0.178 的高准确率准确捕捉 Urdu 手写体的细微差别。尽管在处理某些文本变体方面仍面临挑战,但该模型在实际应用中表现出优越的准确性和有效性。未来工作将致力于通过采用先进的数据增强技术和集成上下文感知语言模型来细化模型,以进一步提升其在 Urdu 文本识别中的性能和鲁棒性。
引用
@article{arxiv.2408.15119,
title = {A Permuted Autoregressive Approach to Word-Level Recognition for Urdu Digital Text},
author = {Ahmed Mustafa and Muhammad Tahir Rafique and Muhammad Ijlal Baig and Hasan Sajid and Muhammad Jawad Khan and Karam Dad Kallu},
journal= {arXiv preprint arXiv:2408.15119},
year = {2024}
}