全梯度DQN强化学习:一种可证明收敛的算法
机器学习
2021-05-05 v3 最优化与控制
概率论
摘要
我们将DQN强化学习算法作为随机逼近格式,利用o.d.e.(即“常微分方程”)方法进行分析,并指出若干理论问题。随后我们提出一种称为全梯度DQN(简称FG-DQN)的改进方案,其具有可靠的理论基础,并在示例问题上与原始方案进行比较。我们观察到FG-DQN具有更优的性能。
引用
@article{arxiv.2103.05981,
title = {Full Gradient DQN Reinforcement Learning: A Provably Convergent Scheme},
author = {K. E. Avrachenkov and V. S. Borkar and H. P. Dolhare and K. Patil},
journal= {arXiv preprint arXiv:2103.05981},
year = {2021}
}