通过可微凸规划寻找高价值训练数据子集
机器学习
2021-04-29 v1
摘要
为深度神经网络寻找有价值的训练数据点一直是一项核心研究挑战,并具有诸多应用。近年来,为解释已训练模型,各种计算单个训练数据点“价值”的技术被提出。然而,一个训练数据点的价值也依赖于其他被选定的训练数据点——这一观念未被现有方法显式刻画。本文研究选取高价值训练数据子集的问题。核心思想是设计一个可学习的在线子集选择框架,其可使用训练数据的 mini-batch 进行学习,从而使我们的方法可扩展。这产生了一个参数化凸子集选择问题,该问题适用于可微凸规划范式,从而允许我们在端到端训练中学习方法选择模型的参数。利用该框架,我们设计了一种基于在线交替最小化的算法,用于联合学习选择模型与 ML 模型的参数。在合成数据集及三个标准数据集上的广泛评估表明,与近期最先进方法相比,我们的算法一致地找到更高价值的训练数据子集,有时比现有方法高约 20% 的价值。这些子集亦有助于发现误标注的训练数据。我们的算法运行时间与现有估值函数相当。
引用
@article{arxiv.2104.13794,
title = {Finding High-Value Training Data Subset through Differentiable Convex Programming},
author = {Soumi Das and Arshdeep Singh and Saptarshi Chatterjee and Suparna Bhattacharya and Sourangshu Bhattacharya},
journal= {arXiv preprint arXiv:2104.13794},
year = {2021}
}