面对上下文的乐观主义:随机上下文 MDP 的悔界保证
机器学习
2023-01-24 v2
摘要
我们提出了在最小可达性假设下、利用离线最小二乘回归预言机访问的随机上下文 MDP 的悔最小化算法。我们分析了三种不同设定:动力学已知、动力学未知但与上下文无关、以及最具挑战性的动力学未知且依赖于上下文的设定。对于后者,我们的算法以 的概率获得 的悔界,其中 和 分别是用于逼近动力学和奖励的有限且可实现的函类, 为最小可达性参数, 为状态集, 为动作集, 为 horizon, 为回合次数。据我们所知,我们的方法是首个应用于具有一般函数逼近(即无需关于函类的额外知识,如线性等)的上下文 MDP 的乐观方法。我们给出了 的期望悔下界,该下界即使在动力学已知的情形式也成立。最后,我们讨论了将结果扩展到无最小可达性 CMDP 的情形,其获得 悔界。
引用
@article{arxiv.2207.11126,
title = {Optimism in Face of a Context: Regret Guarantees for Stochastic Contextual MDP},
author = {Orin Levy and Yishay Mansour},
journal= {arXiv preprint arXiv:2207.11126},
year = {2023}
}