具有少量潜在上下文的奖励混合 MDP 是可学习的
机器学习
2022-10-07 v1 信息论
math.IT
机器学习
摘要
我们考虑奖励混合马尔可夫决策过程(RMMDP)中的情景强化学习:在每一幕开始时,自然从 个候选中随机选择一个潜在奖励模型,智能体在该 MDP 中交互 个时间步。我们的目标是学习一个近似最优策略,在该模型中近乎最大化 时间步的累积奖励。先前工作给出了 时 RMMDP 的上界。本工作中,我们解决了 RMMDP 模型中遗留的几个开放问题。对于任意 ,我们提供了一个样本高效算法————使用 幕输出一个 -最优策略,其中 分别为状态和动作数, 为时间范围, 为奖励分布的支持大小,。我们的技术是基于矩量法方法的高阶扩展,然而 \algname 算法的设计与分析需要超越现有技术的一些新思路。我们还给出了通用 RMMDP 实例的下界 ,表明关于 的超多项式样本复杂度是必要的。
引用
@article{arxiv.2210.02594,
title = {Reward-Mixing MDPs with a Few Latent Contexts are Learnable},
author = {Jeongyeol Kwon and Yonathan Efroni and Constantine Caramanis and Shie Mannor},
journal= {arXiv preprint arXiv:2210.02594},
year = {2022}
}