中文

任意 $p$ 范数下的解耦权重衰减

机器学习 2024-04-24 v2 人工智能 神经与进化计算 最优化与控制

摘要

随着深度神经网络在多个领域的成功,训练和部署大型神经网络的计算和存储需求已成为瓶颈。稀疏化因此成为解决这些问题的主要方法之一。本文考虑一种简单而有效的稀疏化方法,基于在训练过程中对 LpL_p 正则化的桥接。我们引入一种新的权重衰减方案,将标准的 L2L_2 权重衰减推广到任意 pp 范数。我们证明了该方案与自适应优化器兼容,避免了 0<p<10<p<1 范数引起的梯度发散。我们经验性地展示,它导致高度稀疏的网络,同时保持与标准 L2L_2 正则化相当的泛化性能。

关键词

引用

@article{arxiv.2404.10824,
  title  = {Decoupled Weight Decay for Any $p$ Norm},
  author = {Nadav Joseph Outmezguine and Noam Levi},
  journal= {arXiv preprint arXiv:2404.10824},
  year   = {2024}
}

备注

GitHub link: https://github.com/Nadav-out/PAdam