中文

冷案:遗失的 MNIST 数字

机器学习 2019-11-06 v2 计算机视觉与模式识别 机器学习

摘要

尽管流行的 MNIST 数据集 [LeCun et al., 1994] 源自 NIST 数据库 [Grother and Hanaoka, 1995],但这一衍生过程的具体处理步骤已随时间流逝而遗失。我们提出了一种重建方案,其精度足以作为 MNIST 数据集的替代,且准确率变化可忽略不计。我们将每个 MNIST 数字追溯到其 NIST 来源及其丰富的元数据,如书写者标识符、分区标识符等。我们还重建了完整的 MNIST 测试集,包含 60,000 个样本,而非通常的 10,000 个。由于缺失的 50,000 个样本从未被发布,它们使我们能够研究二十五年来 MNIST 实验对报告测试性能的影响。我们的结果明确证实了 Recht 等人 [2018, 2019] 观察到的趋势:尽管误分类率略有偏差,但分类器排序与模型选择总体上仍然可靠。我们将这一现象归因于在相同数字上比较分类器所带来的配对优势。

关键词

引用

@article{arxiv.1905.10498,
  title  = {Cold Case: The Lost MNIST Digits},
  author = {Chhavi Yadav and Léon Bottou},
  journal= {arXiv preprint arXiv:1905.10498},
  year   = {2019}
}

备注

Final NeurIPS version