隐藏协同:L1 权重归一化与 1 路径范数正则化
机器学习
2024-05-01 v1 机器学习
摘要
我们提出了 PSiLON Net,这是一种 MLP 架构,为每个权重向量使用 L1 权重归一化,并在层之间共享长度参数。1 路径范数为神经网络的 Lipschitz 常数提供了上界,并反映其泛化能力,我们展示了 PSiLON Net 的设计如何大幅简化 1 路径范数,同时为高效学习和接近稀疏参数提供归纳偏置。我们提出了一种剪枝方法,以实现训练后期的精确稀疏性。为了利用残差网络的归纳偏置,我们提出了简化的残差模块,利用拼接的 ReLU 激活函数。对于使用此类模块构建的网络,我们证明仅考虑 1 路径范数中可能路径的子集即可界定 Lipschitz 常数。使用 1 路径范数和改进的界作为正则化器,我们在小数据场景中使用过参数化的 PSiLON Net 和 PSiLON ResNet 进行实验,展示了可靠的优化和强大的性能。
引用
@article{arxiv.2404.19112,
title = {Hidden Synergy: $L_1$ Weight Normalization and 1-Path-Norm Regularization},
author = {Aditya Biswas},
journal= {arXiv preprint arXiv:2404.19112},
year = {2024}
}
备注
8 pages body, 2 tables, 1 figure, 3 appendices