基于KHATT数据库的端到端、无分割阿拉伯手写识别模型
计算机视觉与模式识别
2024-06-26 v1 人工智能
摘要
提出一种从头训练的端到端、无分割深度学习模型,利用深度卷积神经网络(DCNN)进行特征提取,联合双向长短期记忆网络(BLSTM)进行序列识别,并采用连接时序分类(CTC)损失函数,在KHATT数据库上实现训练。该训练阶段在测试数据集上实现了84%的字符级识别率和71%的词级识别率,构建了一个仅在行级上运行的基于图像的序列识别框架,无需分割。还介绍了KFUPM手写阿拉伯文本(KHATT)数据库的分析与预处理。最后实现了包括滤波、变换和行分割在内的多种图像处理技术。该工作的重要性体现在其广泛的应用前景,包括银行等领域的数字化、文档、档案和文本翻译。手写阿拉伯文字识别(AHR)是使图像可搜索、增强信息检索能力并实现无需手动编辑的重要工具,这显著减少了阿拉伯数据组织和操作所需的时间和 effort。
引用
@article{arxiv.2406.15329,
title = {An End-to-End, Segmentation-Free, Arabic Handwritten Recognition Model on KHATT},
author = {Sondos Aabed and Ahmad Khairaldin},
journal= {arXiv preprint arXiv:2406.15329},
year = {2024}
}