潜在MDP中的强化学习是可处理的:通过离线策略评估的在线保证
机器学习
2024-06-27 v2 人工智能
系统与控制
系统与控制
摘要
在许多现实世界的决策问题中,存在部分观测、隐藏或潜在的信息,这些信息在整个交互过程中保持不变。这类决策问题可以建模为潜在马尔可夫决策过程,其中潜在变量在交互开始时被选择,并且不向智能体披露。在过去十年中,在不同的结构假设下解决潜在MDP取得了显著进展。然而,对于一般的潜在MDP,没有已知的学习算法能够证明匹配现有的下界。我们引入了第一个无需任何额外结构假设的潜在MDP样本高效算法。我们的结果建立在对离线策略评估保证和潜在MDP中覆盖系数作用的新视角上,这一视角在部分观测环境中的探索背景下被忽视了。具体来说,我们建立了一个新的离线策略评估引理,并引入了潜在MDP的新覆盖系数。然后,我们展示了如何利用这些来推导乐观探索算法的近最优保证。我们相信,这些结果对于潜在MDP之外的广泛交互式学习问题,特别是部分观测环境,都是有价值的。
引用
@article{arxiv.2406.01389,
title = {RL in Latent MDPs is Tractable: Online Guarantees via Off-Policy Evaluation},
author = {Jeongyeol Kwon and Shie Mannor and Constantine Caramanis and Yonathan Efroni},
journal= {arXiv preprint arXiv:2406.01389},
year = {2024}
}
备注
Fixed typos + alpha