Lipi Gnani:一种适用于以卡纳达文印刷的任意语言文档的通用 OCR
计算机视觉与模式识别
2019-01-03 v1
摘要
我们从零开始设计并开发了一款名为 Lipi Gnani 的卡纳达文 OCR,其初衷是能够转换以卡纳达文印刷的文本或诗歌,且不受任何词汇限制。训练集和测试集收集自 1970 年至 2002 年间出版的 35 本以上的书籍,其中包括用 Halegannada 编写的书籍以及包含以卡纳达文书写的梵文颂歌的页面。该 OCR 的覆盖范围几乎是完整的,即它能够识别所有标点符号、特殊符号、印度-阿拉伯数字和卡纳达数字以及夹杂的英文单词。在开发该 OCR 的不同处理阶段(如二值化、行与字符分割、识别和 Unicode 映射)中,做出了多项大大小小的原创贡献。结果表明,这创造了一款性能与 Google 的 Tesseract OCR 相当、在某些情况下甚至更优的卡纳达文 OCR。据作者所知,这是首个处理了所有相关问题的完整卡纳达文 OCR 的报告。目前没有基于字典的后处理,所得结果完全归功于识别过程。创建了四个基准测试数据库,包含来自卡纳达语、梵语、孔卡尼语和 Tulu 语书籍的扫描页面,但所有页面均以卡纳达文印刷。在卡纳达语数据集上,Lipi Gnani 的单词级识别准确率比 Google 的 Tesseract OCR 高 4%,在 Tulu 语和梵语数据集上高 8%,在孔卡尼语数据集上高 25%。
引用
@article{arxiv.1901.00413,
title = {Lipi Gnani - A Versatile OCR for Documents in any Language Printed in Kannada Script},
author = {Shiva Kumar H R and Ramakrishnan A G},
journal= {arXiv preprint arXiv:1901.00413},
year = {2019}
}
备注
21 pages, 16 figures, 12 tables, submitted to ACM Transactions on Asian and Low-Resource Language Information Processing