通过代理进行选择:面向深度学习的高效数据选择
机器学习
2020-10-28 v4 机器学习
摘要
数据选择方法,如主动学习和核心集选择,是处理大型数据集机器学习的有用工具。然而,它们在深度学习中的应用可能因依赖于需要学习的特征表示而计算成本过高。在这项工作中,我们展示了可以通过使用一个小型代理模型来执行数据选择(例如,为主动学习选择要标记的数据点),从而极大地提高计算效率。通过移除目标模型的隐藏层、使用更小的架构以及训练更少的轮次,我们创建了训练速度快一个数量级的代理模型。尽管这些小型代理模型具有更高的错误率,但我们发现它们经验性地为数据选择提供了有用的信号。我们在五个数据集(CIFAR10、CIFAR100、ImageNet、Amazon Review Polarity 和 Amazon Review Full)上的多个数据选择任务中评估了这种“通过代理进行选择”(SVP)方法。对于主动学习,应用 SVP 可以在数据选择运行时间(即反复训练和选择点所需的时间)上带来一个数量级的提升,而不会显著增加最终错误率(通常在 0.1% 以内)。对于 CIFAR10 上的核心集选择,训练速度比其更大、更精确的目标模型快 10 倍以上的代理模型可以移除高达 50% 的数据而不损害目标的最终准确率,从而使端到端训练时间提升 1.6 倍。
引用
@article{arxiv.1906.11829,
title = {Selection via Proxy: Efficient Data Selection for Deep Learning},
author = {Cody Coleman and Christopher Yeh and Stephen Mussmann and Baharan Mirzasoleiman and Peter Bailis and Percy Liang and Jure Leskovec and Matei Zaharia},
journal= {arXiv preprint arXiv:1906.11829},
year = {2020}
}
备注
ICLR 2020