有限 horizon Q-learning:稳定性、收敛性、仿真及在智能电网中的应用
机器学习
2022-08-09 v3 人工智能
摘要
Q-learning 是一种流行的强化学习算法。然而,该算法主要在无限 horizon 设定下被研究和分析。若干重要应用可在有限 horizon 马尔可夫决策过程框架中建模。我们开发了面向有限 horizon 马尔可夫决策过程(MDP)的 Q-learning 算法版本,并给出其稳定性与收敛性的完整证明。我们对有限 horizon Q-learning 的稳定性与收敛性分析完全基于常微分方程(O.D.E)方法。我们还在随机 MDP 设定以及智能电网应用上展示了算法的性能。
引用
@article{arxiv.2110.15093,
title = {Finite Horizon Q-learning: Stability, Convergence, Simulations and an application on Smart Grids},
author = {Vivek VP and Dr. Shalabh Bhatnagar},
journal= {arXiv preprint arXiv:2110.15093},
year = {2022}
}