无魔法之深度:自然梯度下降的归纳偏置
机器学习
2021-11-24 v1 机器学习
摘要
在梯度下降中,改变模型的参数化方式会导致截然不同的优化轨迹,从而产生一系列令人惊讶且有意义的归纳偏置:在无显式正则化的情况下识别稀疏分类器或重构低秩矩阵。这种隐式正则化被假设为深度学习良好泛化的一个促成因素。然而,自然梯度下降近似于对重参数化不变,它总是遵循相同的轨迹并找到相同的最优解。问题自然产生:如果我们消除参数化的作用,会找到何种解,会出现哪些新性质?我们刻画了深度线性网络在逻辑损失下的可分离分类以及深度矩阵分解中自然梯度流的行为。我们的部分发现可推广到具有充分但有限过参数化的非线性神经网络。我们证明,存在自然梯度下降无法泛化而具有合适架构的梯度下降表现良好的学习问题。
引用
@article{arxiv.2111.11542,
title = {Depth Without the Magic: Inductive Bias of Natural Gradient Descent},
author = {Anna Kerekes and Anna Mészáros and Ferenc Huszár},
journal= {arXiv preprint arXiv:2111.11542},
year = {2021}
}