uTHCD:泰米尔语手写体OCR的新基准
计算机视觉与模式识别
2021-07-21 v1 机器学习
摘要
由于书写风格差异大、数据固有噪声、应用广泛以及缺乏基准数据库等诸多原因,手写字符识别在文档图像分析领域数十年来一直是一项具有挑战性的研究。文献中已有大量关于多种印度文字数据库构建的报道,但泰米尔文字仍处于起步阶段,仅见一个数据库报道[5]。本文介绍我们所构建的详尽且大规模无约束泰米尔手写字符数据库(uTHCD)的工作。数据库包含约91000个样本,156个类别每类近600个样本。该数据库是在线与离线样本的统一集合。离线样本通过让志愿者的指定网格内表单上书写收集;在线样本则让志愿者使用数字手写板在类似网格中书写。所收集样本涵盖大量书写风格,以及离线扫描过程固有的畸变如笔画断裂、笔画粗细不均、扭曲等。对此类数据具鲁棒性的算法可实际部署于实时应用。样本来自约650名母语为泰米尔语的志愿者,包括学童、家庭主妇、大学生及教职员工。该孤立字符数据库将以原始图像与层次数据文件(HDF)压缩文件形式公开。借助该数据库,我们期望在泰米尔手写字符识别上设立新基准,并作为文档图像分析领域诸多方向的起点。本文还给出了基于该数据库在卷积神经网络(CNN)上的理想实验设置,测试数据基线精度为88%。
引用
@article{arxiv.2103.07676,
title = {uTHCD: A New Benchmarking for Tamil Handwritten OCR},
author = {Noushath Shaffi and Faizal Hajamohideen},
journal= {arXiv preprint arXiv:2103.07676},
year = {2021}
}
备注
30 pages, 18 figures, in IEEE Access