所有训练样本都是平等创造的吗?一项实证研究
机器学习
2018-12-03 v1 计算机视觉与模式识别
机器学习
摘要
现代计算机视觉算法通常依赖非常大的训练数据集。然而,可以设想的是,精心挑选的数据集子样本足以用于训练。在本文中,我们提出一种基于梯度的重要性度量,并用它来实证分析四个不同复杂度数据集中训练图像的相对重要性。我们发现,在某些情况下,一个小的子样本确实足以用于训练。然而,对于其他数据集,重要性的相对差异可以忽略不计。这些结果对深度网络上的主动学习具有重要启示。此外,我们的分析方法可用作一种通用工具,以更好地理解数据集中训练样本的多样性。
引用
@article{arxiv.1811.12569,
title = {Are All Training Examples Created Equal? An Empirical Study},
author = {Kailas Vodrahalli and Ke Li and Jitendra Malik},
journal= {arXiv preprint arXiv:1811.12569},
year = {2018}
}
备注
12 pages, 12 figures