自然梯度深度 Q-learning
机器学习
2018-11-15 v2 人工智能
机器学习
摘要
我们提出了一种使用自然梯度技术训练深度 Q-learning 智能体的新算法。我们在一组经典控制任务上将原始的深度 Q 网络 (DQN) 算法与其自然梯度对应版本(我们称之为 NGDQN)进行了比较。在不采用目标网络的情况下,NGDQN 显著优于不采用目标网络的 DQN,且表现不差于采用目标网络的 DQN,这表明 NGDQN 能够稳定训练并有助于减少对额外超参数调节的需求。我们还发现,相较于 DQN,NGDQN 对超参数优化的敏感度更低。这些结果共同表明,自然梯度技术可以改进深度强化学习中的值函数优化。
引用
@article{arxiv.1803.07482,
title = {Natural Gradient Deep Q-learning},
author = {Ethan Knight and Osher Lerner},
journal= {arXiv preprint arXiv:1803.07482},
year = {2018}
}