中文

论神经网络预测的可复现性

机器学习 2021-02-08 v1

摘要

神经网络的标准训练技术涉及多种随机性来源,例如初始化、小批量排序,以及在某些情况下数据增强。鉴于神经网络在实践中严重过参数化,此类随机性可能导致{\em 扰动(churn)}——对于相同输入,由同一算法独立训练的两个模型之间的预测不一致,这加剧了现代机器学习中的“可复现性挑战”。在本文中,我们研究这一扰动问题,识别导致其产生的原因,并提出两种缓解该问题的简单方法。我们首先证明扰动确实是一个问题,即便对于标准图像分类任务(CIFAR 和 ImageNet)也是如此,并研究了导致扰动的不同训练随机性来源的作用。通过分析扰动与预测置信度之间的关系,我们采用一种包含两部分的方法来降低扰动。首先,我们提出使用\emph{最小熵正则化器}来提高预测置信度。其次,\changes{我们提出一种 co-distillation 方法~\citep{anil2018large}的新变体,以增加模型一致性并减少扰动}。我们给出的实证结果表明,这两种技术在减少扰动的同时提升了底层模型的准确率。

关键词

引用

@article{arxiv.2102.03349,
  title  = {On the Reproducibility of Neural Network Predictions},
  author = {Srinadh Bhojanapalli and Kimberly Wilber and Andreas Veit and Ankit Singh Rawat and Seungyeon Kim and Aditya Menon and Sanjiv Kumar},
  journal= {arXiv preprint arXiv:2102.03349},
  year   = {2021}
}

备注

19 pages, 7 figures