面向孟加拉语基本字符和数字的多用户手写识别引擎开发
计算机视觉与模式识别
2010-03-31 v1
摘要
本文的目标是使用Apache License 2.0下的Tesseract开源光学字符识别(OCR)引擎识别孟加拉语基本字符的手写样本。从不同用户收集了包含孤立孟加拉语基本字符和数字的手写数据样本。使用文档页面的用户特定数据样本训练Tesseract,以生成代表唯一语言集的独立用户模型。每个这样的语言集识别从指定用户收集的孤立基本孟加拉语手写测试样本。在一个三用户模型上,系统使用919、928和648个孤立手写字符和数字样本进行训练,并在分别从三个用户测试数据集收集的1527、14116和1279个字符和数字样本上测试性能。用户特定的字符/数字识别准确率分别为90.66%、91.66%和96.87%。系统的整体基本字符级和数字级准确率分别为92.15%和97.37%。系统未能分割12.33%的字符和15.96%的数字,并在整个数据集上错误分类了7.85%的字符和2.63%的数字。
引用
@article{arxiv.1003.5897,
title = {Development of a Multi-User Recognition Engine for Handwritten Bangla Basic Characters and Digits},
author = {Sandip Rakshit and Debkumar Ghosal and Tanmoy Das and Subhrajit Dutta and Subhadip Basu},
journal= {arXiv preprint arXiv:1003.5897},
year = {2010}
}
备注
Proc. (CD) Int. Conf. on Information Technology and Business Intelligence (2009)