中文

基于基元的全字体波斯语 OCR 系统

计算机视觉与模式识别 2022-02-15 v1 人工智能 图像与视频处理

摘要

本文介绍一种基于模型的全方位字体波斯语 OCR 系统。该系统使用一组 8 个基元作为识别的结构特征。首先,对扫描文档进行预处理。在将预处理图像归一化后,分离文本行与子词并对其进行细化。在识别子词中的点之后,提取笔画并利用笔画识别每个子词的基元。最后,将基元与预定义的字符识别向量集进行比较以识别子词字符。该系统的分离与识别步骤是并发进行的,消除了独立字母分离不可避免的错误。系统已在 6 种字号下的 14 种标准波斯字体文档上进行测试,所取得的精确率为 97.06%。

关键词

引用

@article{arxiv.2202.06371,
  title  = {Omnifont Persian OCR System Using Primitives},
  author = {Azarakhsh Keipour and Mohammad Eshghi and Sina Mohammadzadeh Ghadikolaei and Negin Mohammadi and Shahab Ensafi},
  journal= {arXiv preprint arXiv:2202.06371},
  year   = {2022}
}

备注

Accepted in IEEE International Conference on Industrial Technology (ICIT 2013); Cape Town, South Africa, 25-27th February 2013 (Not Presented)