ReLU 网络在平方损失下的隐式正则化
机器学习
2021-06-09 v3 机器学习
摘要
理解梯度下降的隐式正则化(或隐式偏置)近期已成为非常活跃的研究领域。然而,非线性神经网络中的隐式正则化仍知之甚少,尤其是对于平方损失等回归损失。或许令人惊讶的是,我们证明即使对单个 ReLU 神经元,也不可能用模型参数的任何显式函数刻画平方损失下的隐式正则化(尽管从积极的一面看,我们表明它可被近似刻画)。对于单隐藏层网络,我们证明了类似结果:一般而言不可能以这种方式刻画隐式正则化性质,除 Du 等人 [2018] 所指出的“平衡性”性质外。我们的结果表明,要理解非线性预测器的隐式正则化,可能需要比目前所考虑的更一般的框架,并为此框架应是什么提供了一些线索。
引用
@article{arxiv.2012.05156,
title = {Implicit Regularization in ReLU Networks with the Square Loss},
author = {Gal Vardi and Ohad Shamir},
journal= {arXiv preprint arXiv:2012.05156},
year = {2021}
}
备注
Small changes due to reviews