具有函数逼近与低 Bellman 秩的马尔可夫决策过程学习的 $\sqrt{n}$ 后悔界
机器学习
2020-06-23 v3 机器学习
摘要
在本文中,我们考虑具有非常大状态空间的马尔可夫决策过程(MDPs)的在线学习问题。在可实现函数逼近和低 Bellman 秩的假设下,我们开发了一种在线学习算法,该算法在学习最优值函数的同时,在学习过程中实现了非常低的累积后悔。我们的学习算法,自适应值函数消除(AVE),受到(Jiang 等人,2017)中提出的策略消除算法(称为 OLIVE)的启发。AVE 的一个关键技术贡献是将 OLIVE 中的消除步骤表述为上下文赌博机问题。该技术使我们能够应用(Dudik 等人,2011)中的主动消除和专家加权方法,而非原始 OLIVE 算法中使用的随机动作探索方案,从而实现更高效的探索并对每个策略消除步骤中产生的后悔进行更好的控制。据我们所知,这是首个针对具有一般值函数逼近的随机 MDPs 强化学习的 后悔结果。
引用
@article{arxiv.1909.02506,
title = {$\sqrt{n}$-Regret for Learning in Markov Decision Processes with Function Approximation and Low Bellman Rank},
author = {Kefan Dong and Jian Peng and Yining Wang and Yuan Zhou},
journal= {arXiv preprint arXiv:1909.02506},
year = {2020}
}
备注
Accepted for presentation at the Conference on Learning Theory (COLT) 2020