在测试数据上训练:移除Fashion-MNIST中的近似重复项
机器学习
2019-06-21 v1 计算机视觉与模式识别
机器学习
摘要
MNIST和Fashion-MNIST在机器学习领域用于测试极为流行。Fashion-MNIST通过引入更困难的问题、增加测试集的多样性以及更准确地代表现代计算机视觉任务,改进了MNIST。为了提高Fashion-MNIST的数据质量,本文研究了训练集与测试集之间的近似重复图像。测试集与训练集之间的近似重复会人为提高机器学习模型的测试准确率。本文识别了Fashion-MNIST中的近似重复图像,并提出了一种移除近似重复的数据集。
引用
@article{arxiv.1906.08255,
title = {Training on test data: Removing near duplicates in Fashion-MNIST},
author = {Christopher Geier},
journal= {arXiv preprint arXiv:1906.08255},
year = {2019}
}