无中生有的一致性:度量梯度对齐的演化
机器学习
2020-08-05 v1 机器学习
摘要
我们提出一种新的度量(-coherence)来实验研究训练过程中逐样本梯度的对齐情况。直观上,给定大小为的样本,-coherencem更具可解释性、计算代价更低(而非)且数学上更简洁。(我们注意到-coherencem,我们研究了ResNet和Inception模型在ImageNet及若干带标签噪声变体上的逐样本梯度对齐演化,特别是从最近提出的Coherent Gradients(CG)理论视角出发,该理论为记忆与泛化提供了简单统一的解释[Chatterjee, ICLR 20]。尽管我们有若干有趣发现,最令人惊讶的结果关乎记忆。直观上,人们可能认为在完全随机标签下训练时,每个例子被独立拟合,因此-coherencem达到高得多的值(数百),表明过参数化神经网络即使在无法泛化的场景中也寻找共同模式。对该现象的详细分析既进一步确证了CG,同时也尖锐地凸显出该理论为完整解释神经网络泛化所缺失的部分。
引用
@article{arxiv.2008.01217,
title = {Making Coherence Out of Nothing At All: Measuring the Evolution of Gradient Alignment},
author = {Satrajit Chatterjee and Piotr Zielinski},
journal= {arXiv preprint arXiv:2008.01217},
year = {2020}
}