ImageNet的缺陷:计算机视觉的热门数据集
计算机视觉与模式识别
2024-12-03 v1
摘要
自ImageNet-1k数据集发布以来,它一直是评估模型性能的金标准。它作为计算机视觉中诸多其他数据集和训练任务的基础。随着模型准确率的提升,与标签正确性相关的问题日益凸显。本博客文章分析了ImageNet-1k数据集中的问题,包括标签错误、类别定义的重叠或模糊、训练-评估领域迁移,以及图像重复。对于一些问题,解决方案是直接的;对于其他问题,我们希望发起讨论,以改进这一影响深远的数据集,使其更好地服务于未来的研究。
引用
@article{arxiv.2412.00076,
title = {Flaws of ImageNet, Computer Vision's Favourite Dataset},
author = {Nikita Kisel and Illia Volkov and Katerina Hanzelkova and Klara Janouskova and Jiri Matas},
journal= {arXiv preprint arXiv:2412.00076},
year = {2024}
}