中文

周期 MDP 中的在线强化学习

机器学习 2023-03-20 v1 人工智能

摘要

我们在平均奖励最大化设定下研究周期马尔可夫决策过程(MDP)中的学习,这是一种特殊类型的非平稳 MDP,其状态转移概率和奖励函数均周期性变化。我们通过将状态空间扩充周期索引将该问题表述为一个平稳 MDP,并提出一种周期上置信界强化学习-2(PUCRL2)算法。我们证明 PUCRL2 的遗憾随周期 NN 线性变化,并随视野长度 TTO(TlogT)\mathcal{O}(\sqrt{Tlog T}) 变化。利用扩充 MDP 转移矩阵稀疏性的信息,我们提出另一种算法 PUCRLB,其在遗憾(对周期的 O(N)O(\sqrt{N}) 依赖)和经验性能两方面均优于 PUCRL2。最后,我们针对环境中周期未知但已知一组候选周期这一扩展不确定性,提出另外两种算法 U-PUCRL2 和 U-PUCRLB。数值结果证明了所有算法的有效性。

关键词

引用

@article{arxiv.2303.09629,
  title  = {Online Reinforcement Learning in Periodic MDP},
  author = {Ayush Aniket and Arpan Chattopadhyay},
  journal= {arXiv preprint arXiv:2303.09629},
  year   = {2023}
}

备注

arXiv admin note: substantial text overlap with arXiv:2207.12045