用于学习率控制的强化学习
机器学习
2017-06-01 v1
摘要
随机梯度下降(SGD)通过在每一步将局部梯度乘以学习率来更新模型参数,被广泛用于神经网络等机器学习算法的模型训练。观察到由SGD训练的模型对学习率敏感,且良好的学习率是特定于问题的。我们提出一种算法,利用深度强化学习(RL)中基于神经网络的actor-critic方法自动学习学习率。具体而言,我们训练一个称为actor的策略网络,以在训练每一步决定学习率,以及一个称为critic的价值网络,对actor所做决策的质量(例如,actor输出的学习率的好坏)给出反馈。辅助actor和critic网络的引入帮助主网络实现更好的性能。在不同数据集和网络架构上的实验表明,我们的方法比人工设计的竞争对手带来SGD更好的收敛性。
引用
@article{arxiv.1705.11159,
title = {Reinforcement Learning for Learning Rate Control},
author = {Chang Xu and Tao Qin and Gang Wang and Tie-Yan Liu},
journal= {arXiv preprint arXiv:1705.11159},
year = {2017}
}
备注
7 pages, 9 figures