通过零阶预言机进行学会学习
机器学习
2020-02-10 v2 机器学习
摘要
在学会学习(L2L)框架中,我们将优化算法的设计视为一个机器学习问题,并使用深度神经网络来学习更新规则。在本文中,我们将L2L框架扩展到零阶(ZO)优化设置,其中没有显式的梯度信息可用。我们的学习到的优化器被建模为循环神经网络(RNN),首先通过ZO梯度估计器近似梯度,然后利用前几次迭代的知识产生参数更新。为了减少由于ZO梯度估计器引起的高方差效应,我们进一步引入另一个RNN来学习高斯采样规则并动态指导查询方向采样。我们的学习到的优化器在合成和实际的ZO优化任务(特别是黑盒对抗攻击任务,这是ZO优化最广泛使用的任务之一)上,在收敛速度和最终解方面均优于手工设计的算法。我们最后进行了广泛的分析实验以证明我们所提出的优化器的有效性。
引用
@article{arxiv.1910.09464,
title = {Learning to Learn by Zeroth-Order Oracle},
author = {Yangjun Ruan and Yuanhao Xiong and Sashank Reddi and Sanjiv Kumar and Cho-Jui Hsieh},
journal= {arXiv preprint arXiv:1910.09464},
year = {2020}
}
备注
Published as a conference paper at ICLR 2020