中文

所有训练样本都是平等创造的吗?一项实证研究

机器学习 2018-12-03 v1 计算机视觉与模式识别 机器学习

摘要

现代计算机视觉算法通常依赖非常大的训练数据集。然而,可以设想的是,精心挑选的数据集子样本足以用于训练。在本文中,我们提出一种基于梯度的重要性度量,并用它来实证分析四个不同复杂度数据集中训练图像的相对重要性。我们发现,在某些情况下,一个小的子样本确实足以用于训练。然而,对于其他数据集,重要性的相对差异可以忽略不计。这些结果对深度网络上的主动学习具有重要启示。此外,我们的分析方法可用作一种通用工具,以更好地理解数据集中训练样本的多样性。

关键词

引用

@article{arxiv.1811.12569,
  title  = {Are All Training Examples Created Equal? An Empirical Study},
  author = {Kailas Vodrahalli and Ke Li and Jitendra Malik},
  journal= {arXiv preprint arXiv:1811.12569},
  year   = {2018}
}

备注

12 pages, 12 figures