中文

在范数正则化中惩罚偏置项可强制稀疏性

机器学习 2025-04-09 v4 机器学习

摘要

训练神经网络时,控制参数的范数常带来良好泛化。除简单直觉外,正则化参数范数与所得估计量之间的关系在理论上仍未被理解。对于具有一维数据的单隐藏层ReLU网络,本工作表明表示某函数所需的参数范数由其二阶导数的全变分给出,并乘以\sqrt{1+x^2}因子加权。值得注意的是,当偏置项的范数未被正则化时,该加权因子消失。此附加加权因子的存在极为重要,因其被证明可强制最小范数插值器的唯一性与稀疏性(就拐点数量而言)。反之,忽略偏置范数会导致非稀疏解。因此,在正则化中显式或隐式地惩罚偏置项会带来稀疏估计量。

关键词

引用

@article{arxiv.2303.01353,
  title  = {Penalising the biases in norm regularisation enforces sparsity},
  author = {Etienne Boursier and Nicolas Flammarion},
  journal= {arXiv preprint arXiv:2303.01353},
  year   = {2025}
}

备注

Corrected a mistake in the previous version of Theorem 4 (appendix)