面向短预热时间折扣 MDP 的无悔最优无模型强化学习
机器学习
2023-12-13 v2 统计理论
机器学习
统计理论
摘要
强化学习中的一个关键问题是学习最优策略。我们在在线设定下的表格无限 horizon 折扣马尔可夫决策过程(MDP)中研究此问题。现有算法要么无法实现后悔最优,要么必须承受较高的内存与计算成本。此外,现有最优算法均需较长的预热时间才能实现最优样本效率,即除非样本量超过较高阈值,否则其最优性无法保证。我们通过引入一种采用方差缩减与一种以缓慢而自适应方式切换执行策略的新颖技术的无模型算法,解决了这两个开放问题。这是折扣设定下首个无悔最优无模型算法,并具有低预热时间的额外优势。
引用
@article{arxiv.2305.15546,
title = {Regret-Optimal Model-Free Reinforcement Learning for Discounted MDPs with Short Burn-In Time},
author = {Xiang Ji and Gen Li},
journal= {arXiv preprint arXiv:2305.15546},
year = {2023}
}