基于模型共识、可解释性与置信学习的ImageNet数据集自动清洗
计算机视觉与模式识别
2021-03-31 v1 机器学习
摘要
在ILSVRC12 ImageNet上训练的卷积神经网络(CNNs)作为通用分类器、特征提取器或迁移学习的基模型,曾是各类应用的骨干。本文描述基于模型共识、可解释性与置信学习的自动化启发式方法,以纠正该数据集中的标注错误并移除模糊图像。在对训练集与验证集作出这些改动后,ImageNet-Clean使SqueezeNet与EfficientNet-B0模型的性能提升2–2.4%。结果支持了更大型图像语料库与半监督学习的重要性,但原始数据集必须被修正,以避免将其错误与偏差传递给下游学习器。进一步的贡献描述了宽屏输入分辨率在竖屏与横屏朝向下的训练影响。训练好的模型与脚本已发布于Github(https://github.com/kecsap/imagenet-clean),用于清洗ImageNet与ImageNetV2数据集以支持可复现研究。
引用
@article{arxiv.2103.16324,
title = {Automated Cleanup of the ImageNet Dataset by Model Consensus, Explainability and Confident Learning},
author = {Csaba Kertész},
journal= {arXiv preprint arXiv:2103.16324},
year = {2021}
}