中文

图像分类数据集中的语义冗余:你不需要的那 10%

计算机视觉与模式识别 2019-02-01 v1 机器学习 机器学习

摘要

近年来,大型数据集对深度学习模型取得成功至关重要,随着使用更多标注数据训练,模型性能持续提升。尽管人们持续努力使这些模型更具数据效率,但理解数据本身所带来的潜在收益在很大程度上尚未被挖掘。具体而言,聚焦于物体识别任务,我们探究对于常见基准数据集,能否优于数据的随机子集,并找到一个在训练时其泛化能力可与完整数据集相媲美的子集。据我们所知,这是首个能在 CIFAR-10 和 ImageNet 数据集(至少 10%)中发现显著冗余的结果。有趣的是,我们观察到所需图像与冗余图像之间存在语义相关性。我们希望我们的发现能够激励进一步研究,以识别额外的冗余并利用它们实现更高效的训练或数据收集。

关键词

引用

@article{arxiv.1901.11409,
  title  = {Semantic Redundancies in Image-Classification Datasets: The 10% You Don't Need},
  author = {Vighnesh Birodkar and Hossein Mobahi and Samy Bengio},
  journal= {arXiv preprint arXiv:1901.11409},
  year   = {2019}
}