损失函数 Lipschitz 性质对 Adam 与 AdamW 优化深度神经网络泛化性能的影响
机器学习
2023-08-23 v3
摘要
深度神经网络相对于优化算法的泛化性能是机器学习中的主要关切之一。该性能受多种因素影响。本文从理论证明,损失函数的 Lipschitz 常数是减小由 Adam 或 AdamW 所得输出模型泛化误差的重要因素。该结果可作为在优化算法为 Adam 或 AdamW 时选择损失函数的指导原则。此外,为在实际设定下评估理论界,我们选取计算机视觉中的人体年龄估计问题。为更好地评估泛化,训练与测试数据集取自不同分布。我们的实验评估表明,具有较低 Lipschitz 常数与最大值的损失函数改善了由 Adam 或 AdamW 训练的模型的泛化能力。
引用
@article{arxiv.2303.16464,
title = {Lipschitzness Effect of a Loss Function on Generalization Performance of Deep Neural Networks Trained by Adam and AdamW Optimizers},
author = {Mohammad Lashkari and Amin Gheibi},
journal= {arXiv preprint arXiv:2303.16464},
year = {2023}
}
备注
Accepted to be published in AUT Journal of Mathematics and Computing (AJMC, 2023)