神经网络中的低秩偏置、权重衰减与模型合并
机器学习
2025-08-21 v2
摘要
我们探讨了具有 正则化(也称为权重衰减)的神经网络在驻点(优化算法的极限解)处权重矩阵的低秩结构。我们展示了由 正则化引发的此类深度神经网络的若干性质。特别地,对于驻点,我们证明了参数与梯度的对齐、跨层的范数保持以及低秩偏置:这些性质先前在梯度下降/流类算法的解的背景下已知。实验表明,分析中所做的假设仅对观测结果产生轻微影响。此外,我们研究了由 正则化和低秩偏置促成的一种多任务学习现象。特别地,我们证明了如果训练两个网络,使得一个网络训练集中的输入与另一个网络训练集中的输入近似正交,则通过简单地将两个网络的权重相加得到的新网络在两个训练集上的表现将与各自的单个网络一样好。我们针对通过梯度下降训练的浅层 ReLU 神经网络以及通过梯度流训练的深度线性网络演示了这一点。
引用
@article{arxiv.2502.17340,
title = {Low-rank bias, weight decay, and model merging in neural networks},
author = {Ilja Kuzborskij and Yasin Abbasi Yadkori},
journal= {arXiv preprint arXiv:2502.17340},
year = {2025}
}