学习具有线性函数逼近的无限时域平均奖赏 MDP 的近极小极大最优遗憾
机器学习
2022-05-11 v2 最优化与控制
机器学习
摘要
我们研究具有线性函数逼近的无限时域平均奖赏设定下的强化学习,其中底层马尔可夫决策过程(MDP)的转移概率函数关于当前状态、动作与下一状态的特征映射具有线性形式。我们提出一种新算法 UCRL2-VTR,可视为带线性函数逼近的 UCRL2 算法的扩展。我们证明带有 Bernstein 型奖励项的 UCRL2-VTR 可达到 的遗憾,其中 为特征映射的维数, 为时域, 为 MDP 的直径。我们还证明了匹配的下界 ,这表明所提出的 UCRL2-VTR 在至多对数因子意义下是极小极大最优的。据我们所知,我们的算法是无限时域平均奖赏设定下首个带函数逼近的近极小极大最优 RL 算法。
引用
@article{arxiv.2102.07301,
title = {Nearly Minimax Optimal Regret for Learning Infinite-horizon Average-reward MDPs with Linear Function Approximation},
author = {Yue Wu and Dongruo Zhou and Quanquan Gu},
journal= {arXiv preprint arXiv:2102.07301},
year = {2022}
}
备注
31 pages, 2 figures. In AISTATS 2022