深度学习模型训练优化方法综述:关于收敛性与泛化性的理论视角
机器学习
2025-01-27 v1 分布式、并行与集群计算
最优化与控制
摘要
随着数据集的规模和复杂度不断增加,从数据集中提取有用特征变得更加困难。因此,深度学习 (DL) 框架正变得越来越流行。DL 和现代所有机器学习中最神秘的挑战之一,是发展对 DL 优化和泛化性的基本理解的 Holy Grail。尽管已在文献中引入了诸多优化技术来导航高度非凸的 DL 优化景观,但许多综述论文主要关注总结这些方法,往往忽略了这些方法的关键理论分析。在本文中,我们提供了 DL 中优化方法的广泛理论基础,包括呈现各种方法、它们的收敛分析以及泛化能力。本文不仅包括对流行的通用梯度基的一阶和二阶方法的理论分析,还涵盖了针对 DL 损失景观特性并明确鼓励发现良好泛化最优点的优化技术的分析。此外,我们将讨论扩展到促进并行计算的分布式优化方法,包括集中式和去中心化方法。我们为本综述论文中考虑的优化算法提供了凸和非凸分析。最后,本文旨在为 DL 的优化方法提供一本全面的理论手册,为 novice 和经验丰富的研究者提供见解和理解。
引用
@article{arxiv.2501.14458,
title = {A Survey of Optimization Methods for Training DL Models: Theoretical Perspective on Convergence and Generalization},
author = {Jing Wang and Anna Choromanska},
journal= {arXiv preprint arXiv:2501.14458},
year = {2025}
}