中文

无中生有的一致性:度量梯度对齐的演化

机器学习 2020-08-05 v1 机器学习

摘要

我们提出一种新的度量(mm-coherence)来实验研究训练过程中逐样本梯度的对齐情况。直观上,给定大小为mm的样本,mm-coherence是样本中平均而言能从任一例子的梯度方向上进行一小步更新而受益的例子数量。我们表明,与其他常用度量相比,是样本中平均而言能从任一例子的梯度方向上进行一小步更新而受益的例子数量。我们表明,与其他常用度量相比,mcoherence-coherence更具可解释性、计算代价更低(O(m)O(m)而非O(m2)O(m^2))且数学上更简洁。(我们注意到mm-coherence与梯度多样性密切相关,后者曾用于某些理论界中。)利用与梯度多样性密切相关,后者曾用于某些理论界中。)利用mcoherence-coherence,我们研究了ResNet和Inception模型在ImageNet及若干带标签噪声变体上的逐样本梯度对齐演化,特别是从最近提出的Coherent Gradients(CG)理论视角出发,该理论为记忆与泛化提供了简单统一的解释[Chatterjee, ICLR 20]。尽管我们有若干有趣发现,最令人惊讶的结果关乎记忆。直观上,人们可能认为在完全随机标签下训练时,每个例子被独立拟合,因此mm-coherence应接近1。然而事实并非如此:训练期间应接近1。然而事实并非如此:训练期间mcoherence-coherence达到高得多的值(数百),表明过参数化神经网络即使在无法泛化的场景中也寻找共同模式。对该现象的详细分析既进一步确证了CG,同时也尖锐地凸显出该理论为完整解释神经网络泛化所缺失的部分。

关键词

引用

@article{arxiv.2008.01217,
  title  = {Making Coherence Out of Nothing At All: Measuring the Evolution of Gradient Alignment},
  author = {Satrajit Chatterjee and Piotr Zielinski},
  journal= {arXiv preprint arXiv:2008.01217},
  year   = {2020}
}