中文

神经网络记忆了什么及为何记忆:通过影响估计揭示长尾现象

机器学习 2020-08-11 v1 机器学习

摘要

深度学习算法以极好地拟合训练数据而闻名,并且常常甚至拟合离群点和错误标注的数据点。这种拟合需要对训练数据标签进行记忆,这一现象已引起大量研究兴趣,但迄今尚未给出令人信服的解释。Feldman (2019) 近期的工作基于两点见解的组合提出了该现象的理论解释。首先,自然图像和数据分布(非正式地)已知是长尾的,即具有显著比例的稀有和非典型样本。其次,在一个简单理论模型中,当数据分布为长尾时,这种记忆对于实现接近最优的泛化误差是必要的。然而,该解释没有直接经验证据,甚至没有给出获取此类证据的方法。本文中我们设计实验来检验该理论中的关键思想。实验需要估计每个训练样本对每个测试样本准确性的影响以及训练样本的记亿值。直接估计这些量在计算上不可行,但我们表明密切相关的子采样影响值和记忆值可以更高效地估计。我们的实验证明了记忆在标准基准上对泛化的显著益处。它们也为 (Feldman, 2019) 提出的理论提供了定量的和视觉上令人信服的证据。

关键词

引用

@article{arxiv.2008.03703,
  title  = {What Neural Networks Memorize and Why: Discovering the Long Tail via Influence Estimation},
  author = {Vitaly Feldman and Chiyuan Zhang},
  journal= {arXiv preprint arXiv:2008.03703},
  year   = {2020}
}