中文

稀疏优化的再参数化、权力衰减与自适应学习率的理论分析

机器学习 2026-05-29 v2 人工智能

摘要

稀疏优化是各种实际应用中的基本挑战。p\ell_p 正则化是稀疏优化的流行方法,但当 0<p<10<p<1 时可能因梯度无界而遇到优化不稳定。在本文中,我们引入一种称为 ReWA 的新型稀疏优化方法,基于再参数化、权力衰减和自适应学习率。ReWA 与 p\ell_p 正则化紧密相关,却揭示了有助于缓解不稳定性问题的不同优化 landscape。在 CIFAR-10 和 ImageNet 上的 ResNet 实验表明,ReWA 在保持测试精度的同时,相较于 1\ell_1 正则化方法实现了显著的稀疏性改进。

关键词

引用

@article{arxiv.2605.25134,
  title  = {Theoretical Analysis of Sparse Optimization with Reparameterization, Weight Decay, and Adaptive Learning Rate},
  author = {Huangyu Xu and Jingqin Yang and Qianqian Xu and Jiaye Teng},
  journal= {arXiv preprint arXiv:2605.25134},
  year   = {2026}
}

备注

31 pages, 5 figures. Submitted to ICML 2026