中文

常用孟加拉手写字素的大规模多目标数据集

计算机视觉与模式识别 2022-06-30 v3 计算与语言 机器学习

摘要

拉丁字母在历史上一向引领着手写光学字符识别(optical character recognition, OCR)研究的最先进水平(state-of-the-art, SOTA)。由于字母表与音节字母文字在正字法上存在尖锐对比,将现有拉丁系统适配到音节字母语言尤其具有挑战性。由于音节字母语系具有连写书写系统且频繁使用变音符,对应于字符的图形成分的分割变得极为困难。我们提出了一种基于字素(词形构成的语段)的标注方案,使音节字母词内部的分割成为线性的,并呈现了首个常用孟加拉手写字素数据集,这些字素在日常语境中常用。该数据集包含 411k 个经过筛选的样本,涉及 1295 个唯一常用孟加拉字素。此外,测试集包含 900 个不常见孟加拉字素用于词典外性能评估。该数据集作为 Kaggle 上公开的手写字素分类挑战赛的一部分开源,以基准测试用于多目标字素分类的视觉算法。本数据集中出现的唯一字素是基于 Google Bengali ASR 语料库中的常见性选取的。从竞赛过程我们看到,深度学习方法能够泛化到大量训练时未出现过的词典外字素。数据集与入门代码见 www.kaggle.com/c/bengaliai-cv19。

关键词

引用

@article{arxiv.2010.00170,
  title  = {A Large Multi-Target Dataset of Common Bengali Handwritten Graphemes},
  author = {Samiul Alam and Tahsin Reasat and Asif Shahriyar Sushmit and Sadi Mohammad Siddiquee and Fuad Rahman and Mahady Hasan and Ahmed Imtiaz Humayun},
  journal= {arXiv preprint arXiv:2010.00170},
  year   = {2022}
}

备注

15 pages, 12 figures, 6 Tables, Submitted to CVPR-21