中文

自然梯度深度 Q-learning

机器学习 2018-11-15 v2 人工智能 机器学习

摘要

我们提出了一种使用自然梯度技术训练深度 Q-learning 智能体的新算法。我们在一组经典控制任务上将原始的深度 Q 网络 (DQN) 算法与其自然梯度对应版本(我们称之为 NGDQN)进行了比较。在不采用目标网络的情况下,NGDQN 显著优于不采用目标网络的 DQN,且表现不差于采用目标网络的 DQN,这表明 NGDQN 能够稳定训练并有助于减少对额外超参数调节的需求。我们还发现,相较于 DQN,NGDQN 对超参数优化的敏感度更低。这些结果共同表明,自然梯度技术可以改进深度强化学习中的值函数优化。

关键词

引用

@article{arxiv.1803.07482,
  title  = {Natural Gradient Deep Q-learning},
  author = {Ethan Knight and Osher Lerner},
  journal= {arXiv preprint arXiv:1803.07482},
  year   = {2018}
}