弱通信MDP中平均奖励离策略控制算法的收敛性
机器学习
2022-11-08 v2
摘要
我们证明了两种平均奖励离策略控制算法——Differential Q-learning(Wan, Naik, & Sutton 2021a)与RVI Q-learning(Abounadi, Bertsekas & Borkar 2001)——在弱通信MDP中收敛。弱通信MDP是能够被具有单一经验流的学习算法求解的最一般MDP。这两种算法的原始收敛性证明要求平均奖励最优方程的解集仅有一个自由度,而这对于弱通信MDP未必成立。据我们所知,我们的结果是首个表明平均奖励离策略控制算法在弱通信MDP中收敛的结果。作为一个直接推广,我们证明了由Wan, Naik, & Sutton(2021b)引入的用于时间抽象的平均奖励options算法,在由options诱导的半MDP为弱通信时收敛。
引用
@article{arxiv.2209.15141,
title = {On Convergence of Average-Reward Off-Policy Control Algorithms in Weakly Communicating MDPs},
author = {Yi Wan and Richard S. Sutton},
journal= {arXiv preprint arXiv:2209.15141},
year = {2022}
}