中文

周期MDP的在线强化学习

机器学习 2022-07-26 v1

摘要

我们在平均奖励最大化设定下研究周期马尔可夫决策过程(MDP)中的学习,这是一种特殊类型的非平稳MDP,其状态转移概率与奖励函数均周期性变化。我们通过将状态空间扩充周期索引将该问题公式化为平稳MDP,并提出一种周期上置信界强化学习-2(PUCRL2)算法。我们证明PUCRL2的遗憾随周期线性变化,并随时域长度次线性变化。数值结果证明了PUCRL2的有效性。

关键词

引用

@article{arxiv.2207.12045,
  title  = {Online Reinforcement Learning for Periodic MDP},
  author = {Ayush Aniket and Arpan Chattopadhyay},
  journal= {arXiv preprint arXiv:2207.12045},
  year   = {2022}
}