冷案:遗失的 MNIST 数字
机器学习
2019-11-06 v2 计算机视觉与模式识别
机器学习
摘要
尽管流行的 MNIST 数据集 [LeCun et al., 1994] 源自 NIST 数据库 [Grother and Hanaoka, 1995],但这一衍生过程的具体处理步骤已随时间流逝而遗失。我们提出了一种重建方案,其精度足以作为 MNIST 数据集的替代,且准确率变化可忽略不计。我们将每个 MNIST 数字追溯到其 NIST 来源及其丰富的元数据,如书写者标识符、分区标识符等。我们还重建了完整的 MNIST 测试集,包含 60,000 个样本,而非通常的 10,000 个。由于缺失的 50,000 个样本从未被发布,它们使我们能够研究二十五年来 MNIST 实验对报告测试性能的影响。我们的结果明确证实了 Recht 等人 [2018, 2019] 观察到的趋势:尽管误分类率略有偏差,但分类器排序与模型选择总体上仍然可靠。我们将这一现象归因于在相同数字上比较分类器所带来的配对优势。
引用
@article{arxiv.1905.10498,
title = {Cold Case: The Lost MNIST Digits},
author = {Chhavi Yadav and Léon Bottou},
journal= {arXiv preprint arXiv:1905.10498},
year = {2019}
}
备注
Final NeurIPS version