将 PAC 强化学习中的确定性等价方法视为轨迹树方法之应用的视角
机器学习
2025-02-24 v2 机器学习
摘要
强化学习(RL)使得与未知 MDP 交互的智能体能够通过观察从 中采样的转移来优化其行为。智能体推理过程中产生的一个自然实体是 ,即基于观察到的转移对 的最大似然估计。著名的确定性等价方法(CEM)指出,智能体应将其行为更新为 ,即 的最优策略。CEM 不仅直观,而且已被证明在具有生成模型的 PAC RL 的参数空间某些区域中具有极小极大最优的样本复杂度~\citep{Agarwal2020GenModel}。一种看似不相关的算法是“轨迹树方法”(TTM)~\citep{Kearns+MN:1999},最初开发用于大型 POMDP 中的高效决策时规划。本文提出了一项理论研究,源于一个令人惊讶的发现:CEM 确实可以被视为 TTM 的应用。这一视角的定性优势在于:(1) 为 CEM 的样本复杂度上界提供了新的简单证明,事实上是在 (2) 比当前文献中普遍采用的更弱的奖励假设下。我们的分析适用于非平稳和平稳 MDP。在定量方面,我们在“错误概率” 较小的情形下,获得了 (3) 非平稳和平稳 MDP 下 CEM 样本复杂度上界的改进。此外,我们展示了 (4) 有限时域 MDP 样本复杂度的下界,这确立了在小 情形下我们针对非平稳 MDP 上界的极小极大最优性。
引用
@article{arxiv.2501.02652,
title = {A View of the Certainty-Equivalence Method for PAC RL as an Application of the Trajectory Tree Method},
author = {Shivaram Kalyanakrishnan and Sheel Shah and Santhosh Kumar Guguloth},
journal= {arXiv preprint arXiv:2501.02652},
year = {2025}
}
备注
15 pages, excluding references and appendices. Total of 29 pages