中文

使用深度Q学习优化控制超参数

最优化与控制 2016-06-21 v2 机器学习

摘要

我们提出了一种关于强化学习状态、动作和奖励函数的新定义,使深度Q网络(DQN)能够学习优化控制超参数。利用Q学习与经验回放,我们训练了两个DQN,将目标函数的状态表示作为输入,输出与调整学习率或保持学习率不变等动作相关的期望折扣回报,即q值。两个DQN学习到一种类似于线搜索的策略,但允许的动作数量不同。训练好的DQN与基于梯度的更新步骤相结合,构成了Q梯度下降算法的基础。为验证该框架的可行性,我们展示了与最优动作相关的DQN的q值收敛,且Q梯度下降算法优于带有Armijo线搜索或非单调线搜索的梯度下降。与传统优化方法不同,Q梯度下降可以纳入任意目标统计量,通过改变动作,我们能够洞察哪些学习率调整策略对神经网络优化是有效的。

关键词

引用

@article{arxiv.1602.04062,
  title  = {Using Deep Q-Learning to Control Optimization Hyperparameters},
  author = {Samantha Hansen},
  journal= {arXiv preprint arXiv:1602.04062},
  year   = {2016}
}