中文

面向手写哈萨克语与俄语的 HKR 数据库

计算机视觉与模式识别 2021-08-31 v2

摘要

在本文中,我们提出了一个用于离线手写识别的新的俄语和哈萨克语数据库(分别约含 95% 的俄语和 5% 的哈萨克语单词/句子)。我们开发了一些与数据库配套的预处理和分割流程。该数据库以西里尔字母书写,并共享相同的 33 个字符。除这些字符外,哈萨克语字母表还包含 9 个额外的特定字符。该数据集是表单的集合。数据集中所有表单的来源均由 \LaTeX 生成,随后由人员用手写填写。该数据库包含超过 1400 份填好的表单。约有 63000 个句子、超过 715699 个符号,由约 200 名不同书写者产生。它可通过深度学习和机器学习服务于手写识别任务领域的研究人员。

关键词

引用

@article{arxiv.2007.03579,
  title  = {HKR For Handwritten Kazakh & Russian Database},
  author = {Daniyar Nurseitov and Kairat Bostanbekov and Daniyar Kurmankhojayev and Anel Alimova and Abdelrahman Abdallah},
  journal= {arXiv preprint arXiv:2007.03579},
  year   = {2021}
}

备注

Multimed Tools Appl (2021)