中文

孟加拉语和天城文手写文本与罗马文字混合的词级文字识别

机器学习 2010-03-25 v1

摘要

印度是一个多语言国家,文本文件中罗马文字常与不同的印度文字一起使用。为了开发特定文字的手写光学字符识别系统,正确识别手写文本的文字是必要的。本文提出一个系统,能够自动从包含孟加拉语或天城文与罗马文字混合的文档中分离出手写单词的文字。在该文字分离技术中,我们首先使用与文字无关的邻域分量分析技术从文档页面中提取文本行和单词。然后,我们设计了一个基于多层感知器的分类器用于文字分离,该分类器使用8种不同的词级整体特征进行训练。准备了两个大小相等的数据集,一个包含孟加拉语和罗马文字,另一个包含天城文和罗马文字,用于系统评估。在各自的独立文本样本上,词级文字识别准确率分别达到99.29%和98.43%。

关键词

引用

@article{arxiv.1002.4007,
  title  = {Word level Script Identification from Bangla and Devanagri Handwritten Texts mixed with Roman Script},
  author = {Ram Sarkar and Nibaran Das and Subhadip Basu and Mahantapas Kundu and Mita Nasipuri and Dipak Kumar Basu},
  journal= {arXiv preprint arXiv:1002.4007},
  year   = {2010}
}