周期 MDP 中的在线强化学习
机器学习
2023-03-20 v1 人工智能
摘要
我们在平均奖励最大化设定下研究周期马尔可夫决策过程(MDP)中的学习,这是一种特殊类型的非平稳 MDP,其状态转移概率和奖励函数均周期性变化。我们通过将状态空间扩充周期索引将该问题表述为一个平稳 MDP,并提出一种周期上置信界强化学习-2(PUCRL2)算法。我们证明 PUCRL2 的遗憾随周期 线性变化,并随视野长度 以 变化。利用扩充 MDP 转移矩阵稀疏性的信息,我们提出另一种算法 PUCRLB,其在遗憾(对周期的 依赖)和经验性能两方面均优于 PUCRL2。最后,我们针对环境中周期未知但已知一组候选周期这一扩展不确定性,提出另外两种算法 U-PUCRL2 和 U-PUCRLB。数值结果证明了所有算法的有效性。
引用
@article{arxiv.2303.09629,
title = {Online Reinforcement Learning in Periodic MDP},
author = {Ayush Aniket and Arpan Chattopadhyay},
journal= {arXiv preprint arXiv:2303.09629},
year = {2023}
}
备注
arXiv admin note: substantial text overlap with arXiv:2207.12045