基于直方图方法的天城文文档分割
计算机视觉与模式识别
2011-09-07 v1
摘要
文档分割是任何语言机器识别中的关键阶段之一。单个符号的正确分割决定了字符识别技术的准确性。它通过分割行和单词,将字符序列的图像分解为单个符号的子图像。天城文是印度最流行的文字,用于书写印地语、马拉地语、梵语和尼泊尔语。此外,印地语是世界第三大流行语言。天城文文档由元音、辅音和各种修饰符组成,因此天城文单词的正确分割具有挑战性。本文提出了一种简单的基于直方图的方法来分割天城文文档,并讨论了天城文文字分割中的各种挑战。
引用
@article{arxiv.1109.1247,
title = {Devnagari document segmentation using histogram approach},
author = {Vikas J Dongre and Vijay H Mankar},
journal= {arXiv preprint arXiv:1109.1247},
year = {2011}
}
备注
8 pages; 4 figures; 8 tables; journal paper: International Journal of Computer Science, Engineering and Information Technology (IJCSEIT), Vol.1, No.3, August 2011