使用Tesseract开源OCR引擎识别手写罗马数字
计算机视觉与模式识别
2010-03-31 v1
摘要
本文旨在利用Tesseract开源光学字符识别(OCR)引擎识别手写罗马数字样本。通过使用不同人员的手写数据样本对Tesseract进行训练,生成一个与用户无关的语言模型,用于表示手写罗马数字集。系统使用从不同用户收集的1226个数字样本进行训练。性能在两个不同的数据集上进行了测试:一个数据集包含来自已知用户(即提供训练数据样本的用户)的样本,另一个数据集包含来自未知用户的手写数据样本。在这两个测试数据集上,整体识别准确率分别为92.1%和86.59%。
引用
@article{arxiv.1003.5898,
title = {Recognition of handwritten Roman Numerals using Tesseract open source OCR engine},
author = {Sandip Rakshit and Amitava Kundu and Mrinmoy Maity and Subhajit Mandal and Satwika Sarkar and Subhadip Basu},
journal= {arXiv preprint arXiv:1003.5898},
year = {2010}
}
备注
Proc. Int. Conf. on Advances in Computer Vision and Information Technology (2009) 572-577