弱梯度方向与强梯度方向:大规模解释记忆化、泛化与样本难度
机器学习
2020-07-22 v2 机器学习
摘要
相干梯度(CGH)是近期提出的一种假设,用于解释为何过参数化神经网络在采用梯度下降训练时能够良好泛化,尽管其容量足以记忆训练集。CGH 的核心洞见是:由于单步 SGD 的总体梯度是各样本梯度的和,若存在能同时降低多个样本损失的梯度方向,则该方向的总体梯度最强。本文中,我们在 ImageNet 上的 ResNet、Inception 和 VGG 模型中验证 CGH。由于原论文所提技术无法扩展到玩具模型与数据集之外,我们提出新方法。通过将抑制弱梯度方向的问题表述为鲁棒均值估计问题,我们开发了基于坐标的均值中位数(median of means)方法。我们给出该算法的两个版本:M3(将小批量划分为 3 组并计算中位数)以及更高效版本 RM3(复用前两个时间步的梯度计算中位数)。由于它们无需逐样本梯度即可抑制弱梯度方向,可用于大规模模型训练。实验上,我们发现它们确实大幅减少过拟合(与记忆化),从而提供 CGH 在大规模下成立的首个令人信服的证据。我们还提出一种不依赖于向训练标签加噪或抑制弱梯度方向的 CGH 新检验。利用 CGH 背后的直觉,我们假定训练过程中早期学习的样本(即“简单”样本)恰是与其他训练样本更具共性的那些。因此,按 CGH,简单样本之间的泛化应优于困难样本之间的泛化。我们通过详尽实验验证该假设,并认为其为 CGH 提供了进一步的正交证据。
引用
@article{arxiv.2003.07422,
title = {Weak and Strong Gradient Directions: Explaining Memorization, Generalization, and Hardness of Examples at Scale},
author = {Piotr Zielinski and Shankar Krishnan and Satrajit Chatterjee},
journal= {arXiv preprint arXiv:2003.07422},
year = {2020}
}