中文

逆向工程解析学习优化器揭示已知与新奇机制

机器学习 2021-12-09 v2 神经与进化计算 机器学习

摘要

学习优化器是一类自身可被训练以求解优化问题的算法。与采用基于理论原理导出的简单更新规则(如动量或Adam)的基线优化器不同,学习优化器使用灵活、高维、非线性的参数化形式。尽管这在某些场景下能带来更优性能,其内部工作机制仍是一个谜。学习优化器何以超越精心调优的基线?它是学到了现有优化技术的复杂组合,还是实现了全新的行为?本文通过对学习优化器的细致分析与可视化来解答这些问题。我们研究了从零开始在三个不同任务上训练的学习优化器,发现它们学到了可解释的机制,包括:动量、梯度裁剪、学习率调度,以及一种新形式的学习率自适应。此外,我们展示了学习优化器的动态特性如何促成这些行为。我们的结果有助于厘清此前对学习优化器工作原理的模糊认识,并为解释未来的学习优化器建立了工具。

关键词

引用

@article{arxiv.2011.02159,
  title  = {Reverse engineering learned optimizers reveals known and novel mechanisms},
  author = {Niru Maheswaranathan and David Sussillo and Luke Metz and Ruoxi Sun and Jascha Sohl-Dickstein},
  journal= {arXiv preprint arXiv:2011.02159},
  year   = {2021}
}

备注

Thirty-Fifth Conference on Neural Information Processing Systems. 2021