中文

Kannada-MNIST:一种用于卡纳达语的新的手写数字数据集

计算机视觉与模式识别 2019-08-06 v1 机器学习 机器学习

摘要

在本文中,我们发布了一个称为 Kannada-MNIST 的、针对卡纳达文字的新的手写数字数据集,它有可能作为原始 MNIST 数据集的直接替代品。除该数据集外,我们还发布了一个额外的真实世界手写数据集(含 10k10k 张图像),我们称之为 Dig-MNIST 数据集,它可作为域外测试数据集。我们也适当地开源了所有代码以及原始扫描图像和扫描仪设置,以便希望尝试不同信号处理流程的研究人员能够进行端到端比较。我们提供了与 MNIST 数据集的高层形态学比较,并给出了所发布数据集的基线准确率。使用常用 CNN 架构获得的初始基线(主测试集 96.8%96.8\%,Dig-MNIST 测试集 76.1%76.1\%)表明,这些数据集在泛化性方面确实比 MNIST 或 KMNIST 数据集提出了更严峻的挑战。我们也希望此次发布将促进为所有使用不同数字符号的语言创建类似的数据集。

关键词

引用

@article{arxiv.1908.01242,
  title  = {Kannada-MNIST: A new handwritten digits dataset for the Kannada language},
  author = {Vinay Uday Prabhu},
  journal= {arXiv preprint arXiv:1908.01242},
  year   = {2019}
}

备注

The companion github repository for this paper is : https://github.com/vinayprabhu/Kannada_MNIST