基于图像识别分类的寺庙古泰米尔文铭文 OCR 新方法
计算机视觉与模式识别
2019-07-12 v1 图像与视频处理
摘要
古泰米尔文字的识别一直是铭文学者面临的挑战。这主要是因为该语言在数个世纪中不断演变,此期间的字符集既有所扩充也有所分化。本工作致力于改进 7 至 12 世纪间使用的古泰米尔文字的光学字符识别(OCR)技术。虽然全面整理古泰米尔字符的功能性数据集是一项艰巨任务,但本工作以该时期某些寺庙铭文上的字符裁剪图像为案例研究,整理了一个数据集。在使用 Otsu 阈值法进行图像二值化后,定义并采用一个二维卷积神经网络来训练、分类并识别古泰米尔字符。为实现光学字符识别技术,该神经网络通过 Python 的 pytesseract 库与 Tesseract 相连。作为附加功能,本工作还集成了 Google 的文本转语音语音引擎,以生成数字化文本的音频输出。我们收集了现代与古泰米尔文的多种样本并输入系统。研究发现,在所考察时间段的泰米尔铭文上,可达到 77.7% 的综合效率。
引用
@article{arxiv.1907.04917,
title = {A Novel Approach to OCR using Image Recognition based Classification for Ancient Tamil Inscriptions in Temples},
author = {Lalitha Giridhar and Aishwarya Dharani and and Velmathi Guruviah},
journal= {arXiv preprint arXiv:1907.04917},
year = {2019}
}
备注
7 pages, 4 figures