镜像,流的镜像:正则化如何塑造隐式偏差
机器学习
2025-08-25 v2
摘要
隐式偏差在解释过参数化模型的良好泛化方面发挥着重要作用。显式正则化(如权重衰减)常被用于防止过拟合。虽然这两个概念都有各自的研究,但在实际应用中,它们往往协同工作。理解它们之间的相互作用对于控制隐式偏差的形状和强度至关重要,因为显式正则化可以修改隐式偏差。为此,我们将显式正则化纳入镜像流框架中,并分析其对训练动力学几何的持久影响,涵盖三个不同的影响:位置偏差、偏差类型和范围缩小。我们的分析方法涵盖了广泛的模型,包括稀疏编码、矩阵感知、单层注意力和 LoRA,其中我们展示了我们的见解的实用性。为利用正则化的持久效应并突出动态权重衰减方案的潜在优势,我们提出在训练期间关闭权重衰减,这在实验中可提高泛化性能。
引用
@article{arxiv.2504.12883,
title = {Mirror, Mirror of the Flow: How Does Regularization Shape Implicit Bias?},
author = {Tom Jacobs and Chao Zhou and Rebekka Burkholz},
journal= {arXiv preprint arXiv:2504.12883},
year = {2025}
}
备注
26 pages, 16 figures