中文

具有少量潜在上下文的奖励混合 MDP 是可学习的

机器学习 2022-10-07 v1 信息论 math.IT 机器学习

摘要

我们考虑奖励混合马尔可夫决策过程(RMMDP)中的情景强化学习:在每一幕开始时,自然从 MM 个候选中随机选择一个潜在奖励模型,智能体在该 MDP 中交互 HH 个时间步。我们的目标是学习一个近似最优策略,在该模型中近乎最大化 HH 时间步的累积奖励。先前工作给出了 M=2M=2 时 RMMDP 的上界。本工作中,我们解决了 RMMDP 模型中遗留的几个开放问题。对于任意 M2M\ge2,我们提供了一个样本高效算法——EM2\texttt{EM}^2——使用 O~(ϵ2SdAdpoly(H,Z)d)\tilde{O} \left(\epsilon^{-2} \cdot S^d A^d \cdot \texttt{poly}(H, Z)^d \right) 幕输出一个 ϵ\epsilon-最优策略,其中 S,AS, A 分别为状态和动作数,HH 为时间范围,ZZ 为奖励分布的支持大小,d=min(2M1,H)d=\min(2M-1,H)。我们的技术是基于矩量法方法的高阶扩展,然而 \algname 算法的设计与分析需要超越现有技术的一些新思路。我们还给出了通用 RMMDP 实例的下界 (SA)Ω(M)/ϵ2(SA)^{\Omega(\sqrt{M})} / \epsilon^{2},表明关于 MM 的超多项式样本复杂度是必要的。

关键词

引用

@article{arxiv.2210.02594,
  title  = {Reward-Mixing MDPs with a Few Latent Contexts are Learnable},
  author = {Jeongyeol Kwon and Yonathan Efroni and Constantine Caramanis and Shie Mannor},
  journal= {arXiv preprint arXiv:2210.02594},
  year   = {2022}
}