基于统计纹理特征的南印度文档手写与印刷文本分类
计算机视觉与模式识别
2013-04-11 v1
摘要
在本文中,我们使用统计纹理特征进行手写和印刷文本分类。我们的主要目标是南印度文字的单词级分类。首先从扫描文档中提取单词。对于每个提取的单词,计算其统计纹理特征,如均值、标准差、平滑度、矩、均匀性、熵和局部范围(包括局部熵)。然后使用这些特征向量通过 k-NN 分类器对单词进行分类。我们在几个不同的数据集上验证了该方法。主要采用了 Kannada、Telugu、Malayalam 和 Hindi(即 Devanagari)等文字,实现了 99.26% 的平均分类率。此外,为了提供该方法的可扩展性,我们使用公开可用的数据集处理了 Roman 文字,并报告了有趣的结果。
引用
@article{arxiv.1303.3087,
title = {Statistical Texture Features based Handwritten and Printed Text Classification in South Indian Documents},
author = {Mallikarjun Hangarge and K. C. Santosh and Srikanth Doddamani and Rajmohan Pardeshi},
journal= {arXiv preprint arXiv:1303.3087},
year = {2013}
}
备注
Appeared in ICECIT-2102