CALText:面向离线手写文本的上下文注意力定位
计算机视觉与模式识别
2021-11-09 v1 机器学习
神经与进化计算
摘要
波斯语和乌尔都语等类阿拉伯文字的识别比基于拉丁字母的文字更具挑战性。这是由于存在二维结构、依赖上下文的字符形状、空格与重叠,以及变音符号的放置。针对离线手写乌尔都语文字的研究甚少,而乌尔都语是世界上第十大通用语言。我们提出了一种基于注意力的编码器-解码器模型,该模型学习在上下文中阅读乌尔都语。我们引入了一种新颖的定位惩罚,以鼓励模型在识别下一个字符时每次仅关注一个位置。此外,我们针对唯一完整且公开可用的手写乌尔都语数据集,在真值标注方面进行了全面精炼。我们在乌尔都语和阿拉伯语数据集上评估了该模型,结果表明上下文注意力定位优于简单注意力模型和多方向 LSTM 模型。
引用
@article{arxiv.2111.03952,
title = {CALText: Contextual Attention Localization for Offline Handwritten Text},
author = {Tayaba Anjum and Nazar Khan},
journal= {arXiv preprint arXiv:2111.03952},
year = {2021}
}
备注
25 pages, 15 figures and 6 tables