中文

Afro-MNIST:面向低资源语言的 MNIST 风格数据集合成生成

计算机视觉与模式识别 2020-09-29 v1 机器学习

摘要

我们提出 Afro-MNIST,一组用于亚非语系与尼日尔-刚果语系四种正字法的 MNIST 风格合成数据集:Ge`ez(埃塞俄比亚文)、Vai、Osmanya 与 N'Ko。这些数据集可作为 MNIST 的“即插即用”替代。我们还描述并开源了一种从每个数字单个样本合成生成 MNIST 风格数据集的方法。这些数据集可在 https://github.com/Daniel-Wu/AfroMNIST 获取。我们希望能为其他数字系统开发 MNIST 风格数据集,并希望这些数据集能活跃研究界中代表性不足国家的机器学习教育。

关键词

引用

@article{arxiv.2009.13509,
  title  = {Afro-MNIST: Synthetic generation of MNIST-style datasets for low-resource languages},
  author = {Daniel J Wu and Andrew C Yang and Vinay U Prabhu},
  journal= {arXiv preprint arXiv:2009.13509},
  year   = {2020}
}

备注

10 pages, 11 figures, presented as a workshop paper at Practical Machine Learning for Developing Countries @ ICLR 2020