中文

有限 horizon Q-learning:稳定性、收敛性、仿真及在智能电网中的应用

机器学习 2022-08-09 v3 人工智能

摘要

Q-learning 是一种流行的强化学习算法。然而,该算法主要在无限 horizon 设定下被研究和分析。若干重要应用可在有限 horizon 马尔可夫决策过程框架中建模。我们开发了面向有限 horizon 马尔可夫决策过程(MDP)的 Q-learning 算法版本,并给出其稳定性与收敛性的完整证明。我们对有限 horizon Q-learning 的稳定性与收敛性分析完全基于常微分方程(O.D.E)方法。我们还在随机 MDP 设定以及智能电网应用上展示了算法的性能。

关键词

引用

@article{arxiv.2110.15093,
  title  = {Finite Horizon Q-learning: Stability, Convergence, Simulations and an application on Smart Grids},
  author = {Vivek VP and Dr. Shalabh Bhatnagar},
  journal= {arXiv preprint arXiv:2110.15093},
  year   = {2022}
}