平坦极小值优化器何时有效?
机器学习
2023-01-30 v5 机器学习
摘要
近来,寻求在低损失邻域内找到参数的平坦极小值优化器,已被证明相比基于随机与自适应梯度的优化器能改善神经网络的泛化性能。由于可扩展性,两种方法受到了显著关注:1. 随机权重平均(SWA),以及 2. 锐度感知最小化(SAM)。然而,对其性质的研究有限,且缺乏跨不同领域的系统性基准测试。我们在此填补这一空白,通过比较各方法训练模型的损失曲面,并在计算机视觉、自然语言处理与图表示学习任务中开展广泛基准测试。我们从这些结果中发现了若干令人惊讶的发现,希望有助于研究者进一步改进深度学习优化器,并帮助实践者为其问题确定合适的优化器。
引用
@article{arxiv.2202.00661,
title = {When Do Flat Minima Optimizers Work?},
author = {Jean Kaddour and Linqing Liu and Ricardo Silva and Matt J. Kusner},
journal= {arXiv preprint arXiv:2202.00661},
year = {2023}
}