稀疏优化的再参数化、权力衰减与自适应学习率的理论分析
机器学习
2026-05-29 v2 人工智能
摘要
稀疏优化是各种实际应用中的基本挑战。 正则化是稀疏优化的流行方法,但当 时可能因梯度无界而遇到优化不稳定。在本文中,我们引入一种称为 ReWA 的新型稀疏优化方法,基于再参数化、权力衰减和自适应学习率。ReWA 与 正则化紧密相关,却揭示了有助于缓解不稳定性问题的不同优化 landscape。在 CIFAR-10 和 ImageNet 上的 ResNet 实验表明,ReWA 在保持测试精度的同时,相较于 正则化方法实现了显著的稀疏性改进。
关键词
引用
@article{arxiv.2605.25134,
title = {Theoretical Analysis of Sparse Optimization with Reparameterization, Weight Decay, and Adaptive Learning Rate},
author = {Huangyu Xu and Jingqin Yang and Qianqian Xu and Jiaye Teng},
journal= {arXiv preprint arXiv:2605.25134},
year = {2026}
}
备注
31 pages, 5 figures. Submitted to ICML 2026