面向手写哈萨克语与俄语的 HKR 数据库
计算机视觉与模式识别
2021-08-31 v2
摘要
在本文中,我们提出了一个用于离线手写识别的新的俄语和哈萨克语数据库(分别约含 95% 的俄语和 5% 的哈萨克语单词/句子)。我们开发了一些与数据库配套的预处理和分割流程。该数据库以西里尔字母书写,并共享相同的 33 个字符。除这些字符外,哈萨克语字母表还包含 9 个额外的特定字符。该数据集是表单的集合。数据集中所有表单的来源均由 \LaTeX 生成,随后由人员用手写填写。该数据库包含超过 1400 份填好的表单。约有 63000 个句子、超过 715699 个符号,由约 200 名不同书写者产生。它可通过深度学习和机器学习服务于手写识别任务领域的研究人员。
引用
@article{arxiv.2007.03579,
title = {HKR For Handwritten Kazakh & Russian Database},
author = {Daniyar Nurseitov and Kairat Bostanbekov and Daniyar Kurmankhojayev and Anel Alimova and Abdelrahman Abdallah},
journal= {arXiv preprint arXiv:2007.03579},
year = {2021}
}
备注
Multimed Tools Appl (2021)