中文

面对上下文的乐观主义:随机上下文 MDP 的悔界保证

机器学习 2023-01-24 v2

摘要

我们提出了在最小可达性假设下、利用离线最小二乘回归预言机访问的随机上下文 MDP 的悔最小化算法。我们分析了三种不同设定:动力学已知、动力学未知但与上下文无关、以及最具挑战性的动力学未知且依赖于上下文的设定。对于后者,我们的算法以 1δ1-\delta 的概率获得 O~((H+1/pmin)HS3/2ATlog(max{G,P}/δ))\widetilde{O}( (H+{1}/{p_{min}})H|S|^{3/2}\sqrt{|A|T\log(\max\{|\mathcal{G}|,|\mathcal{P}|\}/\delta)}) 的悔界,其中 P\mathcal{P}G\mathcal{G} 分别是用于逼近动力学和奖励的有限且可实现的函类,pminp_{min} 为最小可达性参数,SS 为状态集,AA 为动作集,HH 为 horizon,TT 为回合次数。据我们所知,我们的方法是首个应用于具有一般函数逼近(即无需关于函类的额外知识,如线性等)的上下文 MDP 的乐观方法。我们给出了 Ω(THSAln(G)/ln(A))\Omega(\sqrt{T H |S| |A| \ln(|\mathcal{G}|)/\ln(|A|)}) 的期望悔下界,该下界即使在动力学已知的情形式也成立。最后,我们讨论了将结果扩展到无最小可达性 CMDP 的情形,其获得 O~(T3/4)\widetilde{O}(T^{3/4}) 悔界。

关键词

引用

@article{arxiv.2207.11126,
  title  = {Optimism in Face of a Context: Regret Guarantees for Stochastic Contextual MDP},
  author = {Orin Levy and Yishay Mansour},
  journal= {arXiv preprint arXiv:2207.11126},
  year   = {2023}
}