中文

针对随机梯度下降训练模型的数据清洗方法

机器学习 2019-06-21 v1 机器学习

摘要

数据清洗是提高机器学习模型准确性的一种典型方法,然而它需要大量的领域知识来识别影响模型的具有影响力的样本。在本文中,我们提出一种无需使用任何领域知识即可推荐具有影响力样本的算法。利用所提出的方法,用户只需检查算法推荐的样本,这意味着用户在此过程中不需要大量知识,使得即使是非专家也能进行数据清洗并改进模型。现有方法要求损失函数为凸且获得最优模型,而现代机器学习中并非总是如此。为克服这些局限,我们提出一种专为随机梯度下降(SGD)训练的模型设计的新型方法。该方法通过回溯 SGD 的每一步并整合每步计算的中间模型来推断具有影响力的样本。通过实验,我们证明所提方法能准确推断具有影响力的样本。此外,我们使用 MNIST 和 CIFAR10 表明,通过移除所提方法推荐的具有影响力的样本,模型可得到有效改进。

关键词

引用

@article{arxiv.1906.08473,
  title  = {Data Cleansing for Models Trained with SGD},
  author = {Satoshi Hara and Atsushi Nitanda and Takanori Maehara},
  journal= {arXiv preprint arXiv:1906.08473},
  year   = {2019}
}