基于后验采样的情节式 POMDP 在线学习
机器学习
2024-10-24 v4 人工智能
系统与控制
系统与控制
机器学习
摘要
在 POMDP 中学习已知远比在 MDP 中困难。本文考虑具有未知转移与观测模型的情节式 POMDP 的在线学习问题。我们提出一种用于 POMDP 的基于后验采样的强化学习算法(PS4POMDPs),相较于最先进的基于乐观主义的 POMDP 在线学习算法,其更为简单且更易实现。我们证明所提算法的贝叶斯遗憾(Bayesian regret)随情节数平方根缩放,且对其他参数呈多项式依赖。在一般设定下,该遗憾随 horizon 长度 指数缩放,我们通过给出下界表明此乃不可避免。然而,当 POMDP 为欠完备且弱揭示(近期文献中的常见假设)时,我们建立了多项式贝叶斯遗憾界。最后,我们提出一种用于多智能体 POMDP 的后验采样算法,并证明其亦具有次线性遗憾。
引用
@article{arxiv.2310.10107,
title = {Posterior Sampling-based Online Learning for Episodic POMDPs},
author = {Dengwang Tang and Dongze Ye and Rahul Jain and Ashutosh Nayyar and Pierluigi Nuzzo},
journal= {arXiv preprint arXiv:2310.10107},
year = {2024}
}
备注
41 pages, 9 figures