中文

基于存储高效影响函数近似的深度学习神经网络数据清洗

机器学习 2021-06-02 v2 人工智能

摘要

识别训练数据的影响以进行数据清洗可提升深度学习的准确率。已有一种称为SGD-influence的随机梯度下降(SGD)方法用于计算影响分数,但其计算代价高昂。为在推断阶段计算影响分数,需在训练阶段临时存储模型参数。紧接此前方法,我们提出一种减少训练阶段用于存储参数以计算推断分数的缓存文件的方法。我们仅采用最后一轮(epoch)的最终参数进行影响函数计算。在分类实验中,使用MNIST数据集时我们方法的训练缓存大小为1.236 MB。相比之下,此前方法在最后一轮使用了1.932 GB的缓存大小。这意味着缓存大小已缩减至1/1563。我们还观察到,使用我们的方法与此前方法通过移除负影响数据来进行数据清洗均带来了准确率提升。此外,我们提出的这种简单且通用的计算影响分数方法已可在无需编程的自动机器学习工具Neural Network Console上使用。源代码亦已公开。

关键词

引用

@article{arxiv.2103.11807,
  title  = {Data Cleansing for Deep Neural Networks with Storage-efficient Approximation of Influence Functions},
  author = {Kenji Suzuki and Yoshiyuki Kobayashi and Takuya Narihira},
  journal= {arXiv preprint arXiv:2103.11807},
  year   = {2021}
}