任意 $p$ 范数下的解耦权重衰减
机器学习
2024-04-24 v2 人工智能
神经与进化计算
最优化与控制
摘要
随着深度神经网络在多个领域的成功,训练和部署大型神经网络的计算和存储需求已成为瓶颈。稀疏化因此成为解决这些问题的主要方法之一。本文考虑一种简单而有效的稀疏化方法,基于在训练过程中对 正则化的桥接。我们引入一种新的权重衰减方案,将标准的 权重衰减推广到任意 范数。我们证明了该方案与自适应优化器兼容,避免了 范数引起的梯度发散。我们经验性地展示,它导致高度稀疏的网络,同时保持与标准 正则化相当的泛化性能。
引用
@article{arxiv.2404.10824,
title = {Decoupled Weight Decay for Any $p$ Norm},
author = {Nadav Joseph Outmezguine and Noam Levi},
journal= {arXiv preprint arXiv:2404.10824},
year = {2024}
}
备注
GitHub link: https://github.com/Nadav-out/PAdam