Oracle-MNIST:用于基准测试机器学习算法的甲骨文数据集
计算机视觉与模式识别
2024-02-14 v2
摘要
我们介绍了 Oracle-MNIST 数据集,包含 30,222 个来自 10 类的古代字符的 2828 灰度图像,用于基准测试模式分类,在图像噪声和失真方面具有特殊挑战。训练集总共由 27,222 张图像组成,测试集每类包含 300 张图像。Oracle-MNIST 与原始 MNIST 数据集共享相同的数据格式,可与所有现有分类器和系统直接兼容,但其构成比 MNIST 更具挑战性的分类任务。古代字符的图像遭受 1)由三千年埋藏和老化引起的极其严重且独特的噪声,以及 2)古代中国人书写风格显著多变的影响,这些都使它们对机器学习研究而言真实可信。该数据集可在 https://github.com/wm-bupt/oracle-mnist 免费获取。
引用
@article{arxiv.2205.09442,
title = {Oracle-MNIST: a Dataset of Oracle Characters for Benchmarking Machine Learning Algorithms},
author = {Mei Wang and Weihong Deng},
journal= {arXiv preprint arXiv:2205.09442},
year = {2024}
}
备注
Accept by Scientific Data