中文

我们是否在测试数据上训练?清除 CIFAR 中的近似重复项

计算机视觉与模式识别 2020-06-03 v2

摘要

CIFAR-10 与 CIFAR-100 数据集是计算机视觉中基准测试最繁重的两个数据集,常用于评估深度学习领域的新方法与模型架构。然而,我们发现这些数据集测试集中分别有 3.3% 和 10% 的图像在训练集中存在重复。这些重复项易被记忆识别,因此可能使图像识别技术关于其泛化能力的比较产生偏差。为消除此偏差,我们提供了“公平 CIFAR”(ciFAIR)数据集,以来自同一域的新图像替换了测试集中的所有重复项。随后我们在这些新测试集上重新评估了多种流行 SOTA CNN 架构的分类性能,以探究近期研究是否过拟合于记忆数据而非学习抽象概念。我们发现,相对于原始在去重测试集上的性能,分类准确率显著下降了 9% 至 14%。ciFAIR 数据集与预训练模型可在 https://cvjena.github.io/cifair/ 获取,我们也在该处维护排行榜。

关键词

引用

@article{arxiv.1902.00423,
  title  = {Do We Train on Test Data? Purging CIFAR of Near-Duplicates},
  author = {Björn Barz and Joachim Denzler},
  journal= {arXiv preprint arXiv:1902.00423},
  year   = {2020}
}

备注

Journal of Imaging