中文

用于 CTR 预测中神经网络的带稀疏组 Lasso 的自适应优化器

机器学习 2024-12-06 v6

摘要

我们开发了一个新颖框架,将稀疏组 lasso 的正则化项添加到深度学习中的一类自适应优化器(如 Momentum、Adagrad、Adam、AMSGrad、AdaHessian)中,并相应地创建了一类新的优化器,命名为 Group Momentum、Group Adagrad、Group Adam、Group AMSGrad 和 Group AdaHessian 等。基于原始对偶方法,我们在随机凸设置下建立了理论证明的收敛保证。我们在三个大规模真实世界广告点击数据集上,使用最先进的深度学习模型评估了我们新优化器的正则化效果。实验结果表明,与采用幅度剪枝方法的后处理流程的原始优化器相比,模型在相同稀疏度水平上的性能可显著提升。此外,与无幅度剪枝的情况相比,我们的方法能以极高稀疏度实现显著更优或极具竞争力的性能。代码可在 https://github.com/intelligent-machine-learning/tfplus/tree/main/tfplus 获取。

关键词

引用

@article{arxiv.2107.14432,
  title  = {Adaptive Optimizers with Sparse Group Lasso for Neural Networks in CTR Prediction},
  author = {Yun Yue and Yongchao Liu and Suo Tong and Minghao Li and Zhen Zhang and Chunyang Wen and Huanjun Bao and Lihong Gu and Jinjie Gu and Yixiang Mu},
  journal= {arXiv preprint arXiv:2107.14432},
  year   = {2024}
}

备注

24 pages. Published as a conference paper at ECML PKDD 2021. This version includes Appendix which was not included in the published version because of page limit