基于基元的全字体波斯语 OCR 系统
计算机视觉与模式识别
2022-02-15 v1 人工智能
图像与视频处理
摘要
本文介绍一种基于模型的全方位字体波斯语 OCR 系统。该系统使用一组 8 个基元作为识别的结构特征。首先,对扫描文档进行预处理。在将预处理图像归一化后,分离文本行与子词并对其进行细化。在识别子词中的点之后,提取笔画并利用笔画识别每个子词的基元。最后,将基元与预定义的字符识别向量集进行比较以识别子词字符。该系统的分离与识别步骤是并发进行的,消除了独立字母分离不可避免的错误。系统已在 6 种字号下的 14 种标准波斯字体文档上进行测试,所取得的精确率为 97.06%。
引用
@article{arxiv.2202.06371,
title = {Omnifont Persian OCR System Using Primitives},
author = {Azarakhsh Keipour and Mohammad Eshghi and Sina Mohammadzadeh Ghadikolaei and Negin Mohammadi and Shahab Ensafi},
journal= {arXiv preprint arXiv:2202.06371},
year = {2022}
}
备注
Accepted in IEEE International Conference on Industrial Technology (ICIT 2013); Cape Town, South Africa, 25-27th February 2013 (Not Presented)