中文

BanglaWriting:一个多用途离线孟加拉语手写数据集

计算机视觉与模式识别 2022-08-22 v3 机器学习

摘要

本文提出一个名为 BanglaWriting 的孟加拉语手写数据集,包含 260 名不同身份与年龄个体的单页手写样本。每页包含界定每个词的边界框,以及该手写的 Unicode 表示。该数据集共计含 21,234 个词与 32,787 个字符,此外还包括 5,470 个孟加拉语词汇中的唯一词。除常规词外,数据集还包含 261 处可辨识的覆写以及 450 处手写划除与错误。所有边界框与词标签均为人工生成。该数据集可用于复杂光学字符/词识别、书写者识别、手写词分割与词生成。此外,该数据集适用于提取基于年龄与性别的手写变异。

关键词

引用

@article{arxiv.2011.07499,
  title  = {BanglaWriting: A multi-purpose offline Bangla handwriting dataset},
  author = {M. F. Mridha and Abu Quwsar Ohi and M. Ameer Ali and Mazedul Islam Emon and Muhammad Mohsin Kabir},
  journal= {arXiv preprint arXiv:2011.07499},
  year   = {2022}
}

备注

Accepted in journal Data in Brief. The dataset is available on https://data.mendeley.com/datasets/r43wkvdk4w/