神经网络为何找到简单解:几何复杂度的多种正则化器
机器学习
2022-12-27 v2 机器学习
摘要
在许多情形下,较简单的模型优于较复杂的模型,而对模型复杂度的控制是机器学习中许多方法(如正则化、超参数调优与架构设计)的目标。在深度学习中,由于许多传统度量并不天然适用于深度神经网络,理解复杂度控制的内在机制一直较为困难。在此我们发展几何复杂度的概念,它是一种利用离散狄利克雷能量计算的模型函数变异性度量。通过理论论证与经验结果的结合,我们表明许多常见训练启发式方法,如参数范数正则化、谱范数正则化、平坦度正则化、隐式梯度正则化、噪声正则化以及参数初始化选择,均起到控制几何复杂度的作用,从而提供一个统一框架来刻画深度学习模型的行为。
引用
@article{arxiv.2209.13083,
title = {Why neural networks find simple solutions: the many regularizers of geometric complexity},
author = {Benoit Dherin and Michael Munn and Mihaela Rosca and David G. T. Barrett},
journal= {arXiv preprint arXiv:2209.13083},
year = {2022}
}
备注
Accepted as a NeurIPS 2022 paper