中文

学习可证明地改善梯度下降的收敛性

机器学习 2025-12-24 v6 最优化与控制

摘要

学习优化(Learn to Optimize, L2O)通过深度神经网络训练求解器,成功于加速凸问题和改进非凸解。然而,L2O 缺乏对自身训练收敛的严格理论支持,因为现有分析常使用不切实际的假设——这一差距本工作通过经验验证了。我们通过利用神经张量核(NTK)理论,为学习梯度下降(GD)超参数的 L2O 模型证明了训练收敛性。我们提出了一种确定性初始化策略以支持我们的理论结果,并通过缓解梯度爆炸来促进稳定的训练,使其在更长的优化时段内保持稳定。我们的 L2O 框架在合成数据集上比 GD 性能更好超过 50\%,并在最先进的 L2O 方法中表现出优越的鲁棒性。本方法的代码可在 https://github.com/NetX-lab/MathL2OProof-Official 查看。

关键词

引用

@article{arxiv.2501.18092,
  title  = {Learning Provably Improves the Convergence of Gradient Descent},
  author = {Qingyu Song and Wei Lin and Hong Xu},
  journal= {arXiv preprint arXiv:2501.18092},
  year   = {2025}
}

备注

48 pages, 11 figures, NeurIPS 2025