逆向工程解析学习优化器揭示已知与新奇机制
机器学习
2021-12-09 v2 神经与进化计算
机器学习
摘要
学习优化器是一类自身可被训练以求解优化问题的算法。与采用基于理论原理导出的简单更新规则(如动量或Adam)的基线优化器不同,学习优化器使用灵活、高维、非线性的参数化形式。尽管这在某些场景下能带来更优性能,其内部工作机制仍是一个谜。学习优化器何以超越精心调优的基线?它是学到了现有优化技术的复杂组合,还是实现了全新的行为?本文通过对学习优化器的细致分析与可视化来解答这些问题。我们研究了从零开始在三个不同任务上训练的学习优化器,发现它们学到了可解释的机制,包括:动量、梯度裁剪、学习率调度,以及一种新形式的学习率自适应。此外,我们展示了学习优化器的动态特性如何促成这些行为。我们的结果有助于厘清此前对学习优化器工作原理的模糊认识,并为解释未来的学习优化器建立了工具。
引用
@article{arxiv.2011.02159,
title = {Reverse engineering learned optimizers reveals known and novel mechanisms},
author = {Niru Maheswaranathan and David Sussillo and Luke Metz and Ruoxi Sun and Jascha Sohl-Dickstein},
journal= {arXiv preprint arXiv:2011.02159},
year = {2021}
}
备注
Thirty-Fifth Conference on Neural Information Processing Systems. 2021