GLISTER:基于泛化能力的数据子集选择以实现高效且鲁棒的学习
机器学习
2021-06-15 v4 人工智能
摘要
大规模机器学习和深度模型极其耗费数据。不幸的是,获取大量标注数据成本高昂,且训练最先进的模型(含超参数调优)需要大量的计算资源和时间。其次,现实世界的数据是有噪声且不均衡的。因此,近期的若干论文试图使训练过程更高效且更鲁棒。然而,大多数现有工作要么关注鲁棒性,要么关注效率,而非两者兼顾。在本工作中,我们引入 Glister,一个基于泛化能力的数据子集选择以实现高效且鲁棒学习(GeneraLIzation based data Subset selecTion for Efficient and Robust learning)的框架。我们将 Glister 表述为一个混合离散-连续双层优化问题,以选择训练数据的子集,从而最大化在留出验证集上的对数似然。接下来,我们提出一种迭代在线算法 Glister-Online,它随着参数更新迭代地执行数据选择,并可应用于任何基于损失的学习算法。然后我们证明,对于包括交叉熵、铰链损失、平方损失和逻辑损失在内的一类丰富损失函数,内层离散数据选择是(弱)子模优化的一个实例,并分析了 Glister-Online 降低验证损失并收敛的条件。最后,我们提出 Glister-Active,作为对批量主动学习的扩展,并在广泛的任务上实证展示了 Glister 的性能,包括 (a) 减少训练时间的数据选择,(b) 在标签噪声和不均衡设定下的鲁棒学习,以及 (c) 使用若干深度与浅层模型的批量主动学习。我们表明,我们的框架在效率和准确率上均优于最先进水平(在情形 (a) 和 (c) 中),并且在情形 (b) 中相较于其他最先进的鲁棒学习算法更为高效。
引用
@article{arxiv.2012.10630,
title = {GLISTER: Generalization based Data Subset Selection for Efficient and Robust Learning},
author = {Krishnateja Killamsetty and Durga Sivasubramanian and Ganesh Ramakrishnan and Rishabh Iyer},
journal= {arXiv preprint arXiv:2012.10630},
year = {2021}
}