使用Tesseract开源OCR引擎识别手写文本注释以支持即时信息(iJIT)系统
计算机视觉与模式识别
2010-03-31 v1
摘要
当前工作的目标是为即时信息(iJIT)系统开发一个光学字符识别(OCR)引擎,用于识别小写罗马字体的手写文本注释。采用Apache License 2.0下的Tesseract开源OCR引擎,为所述系统开发用户特定的手写识别模型,即语言集,其中每个用户通过数字笔关联的唯一识别标签进行标识。为生成任意用户的语言集,使用从该用户独家收集的孤立和自由流动罗马字体手写数据样本对Tesseract进行训练。所设计的系统在五个不同的语言集上进行了测试,测试样本为自由流动的手写注释。该系统成功分割并识别了五个不同用户测试样本中87.92%、81.53%、92.88%、86.75%和90.80%的手写字符。
引用
@article{arxiv.1003.5893,
title = {Recognition of Handwritten Textual Annotations using Tesseract Open Source OCR Engine for information Just In Time (iJIT)},
author = {Sandip Rakshit and Subhadip Basu and Hisashi Ikeda},
journal= {arXiv preprint arXiv:1003.5893},
year = {2010}
}
备注
Proc. Int. Conf. on Information Technology and Business Intelligence (2009) 117-125