我们是否在测试数据上训练?清除 CIFAR 中的近似重复项
计算机视觉与模式识别
2020-06-03 v2
摘要
CIFAR-10 与 CIFAR-100 数据集是计算机视觉中基准测试最繁重的两个数据集,常用于评估深度学习领域的新方法与模型架构。然而,我们发现这些数据集测试集中分别有 3.3% 和 10% 的图像在训练集中存在重复。这些重复项易被记忆识别,因此可能使图像识别技术关于其泛化能力的比较产生偏差。为消除此偏差,我们提供了“公平 CIFAR”(ciFAIR)数据集,以来自同一域的新图像替换了测试集中的所有重复项。随后我们在这些新测试集上重新评估了多种流行 SOTA CNN 架构的分类性能,以探究近期研究是否过拟合于记忆数据而非学习抽象概念。我们发现,相对于原始在去重测试集上的性能,分类准确率显著下降了 9% 至 14%。ciFAIR 数据集与预训练模型可在 https://cvjena.github.io/cifair/ 获取,我们也在该处维护排行榜。
引用
@article{arxiv.1902.00423,
title = {Do We Train on Test Data? Purging CIFAR of Near-Duplicates},
author = {Björn Barz and Joachim Denzler},
journal= {arXiv preprint arXiv:1902.00423},
year = {2020}
}
备注
Journal of Imaging