中文

良性记忆化的奇特现象

机器学习 2023-02-24 v3

摘要

尽管深度学习在各类学习任务中取得了经验性进展,我们对其成功背后的理论理解仍十分有限。关键挑战之一在于现代模型的过参数化本质,使得即便标签被随机化,模型也能完全过拟合数据,即网络可以完全“记忆”所有给定模式。虽然这种记忆能力看似令人担忧,但在本工作中我们表明,在包含数据增强的训练策略下,神经网络以一种良性的方式学习记忆完全随机的标签,即它们学习到的嵌入在最近邻探测下能带来高度非平凡的性能。我们证明,深度模型具有将记忆与特征学习的任务分配至不同层从而分离噪声与信号的惊人能力。结果,仅最末几层用于记忆,而先前各层编码了基本不受标签噪声影响的有效特征。我们探究了训练所用增强方式的复杂作用,并从其多样性角度识别出一种记忆—泛化权衡,这与以往所有工作形成清晰区分。最后,我们通过表明在数据增强下恶性记忆因模型对增大样本量的容量不足而不可行,对良性记忆的出现给出了首个解释。因此,网络被迫利用增强的相关性,从而学习到有意义的特征。为完整刻画该现象,需建立更好的深度神经网络特征学习理论以充分理解此现象起源。

关键词

引用

@article{arxiv.2210.14019,
  title  = {The Curious Case of Benign Memorization},
  author = {Sotiris Anagnostidis and Gregor Bachmann and Lorenzo Noci and Thomas Hofmann},
  journal= {arXiv preprint arXiv:2210.14019},
  year   = {2023}
}