基于MLP和SVM分类器的手写孟加拉语基本字符与复合字符识别
计算机视觉与模式识别
2010-03-25 v2 机器学习
摘要
本文提出了一种新颖的手写孟加拉语复合字符以及孟加拉字母表基本字符的识别方法。与罗马字母(如英语)相比,手写孟加拉语光学字符识别(OCR)的主要障碍之一是孟加拉字母表中存在大量形状复杂的字符类别。除了50个基本字符类别外,孟加拉字母表中还有近160个形状复杂的复合字符类别。用设计得当的特征集处理如此多种类的手写字符是一个具有挑战性的问题。手写体本身具有不确定性和不精确性。此外,如此大量形状复杂的字符(其中一些字符非常相似)使得手写孟加拉字符的OCR问题更加困难。考虑到问题的复杂性,本方法尝试按照从最常见到较少出现的顺序(即按重要性顺序)来识别复合字符类别。这是为了开发一个框架,能够逐步增加所学复合字符类别的数量,从最常见的到较少出现的,同时包含基本字符。实验表明,经过三折交叉验证,该技术的平均识别率达到79.25%,并且具有未来改进和扩展的空间。
引用
@article{arxiv.1002.4040,
title = {Handwritten Bangla Basic and Compound character recognition using MLP and SVM classifier},
author = {Nibaran Das and Bindaban Das and Ram Sarkar and Subhadip Basu and Mahantapas Kundu and Mita Nasipuri},
journal= {arXiv preprint arXiv:1002.4040},
year = {2010}
}