中文

将 PAC 强化学习中的确定性等价方法视为轨迹树方法之应用的视角

机器学习 2025-02-24 v2 机器学习

摘要

强化学习(RL)使得与未知 MDP MM 交互的智能体能够通过观察从 MM 中采样的转移来优化其行为。智能体推理过程中产生的一个自然实体是 M^\widehat{M},即基于观察到的转移对 MM 的最大似然估计。著名的确定性等价方法(CEM)指出,智能体应将其行为更新为 π^\widehat{\pi},即 M^\widehat{M} 的最优策略。CEM 不仅直观,而且已被证明在具有生成模型的 PAC RL 的参数空间某些区域中具有极小极大最优的样本复杂度~\citep{Agarwal2020GenModel}。一种看似不相关的算法是“轨迹树方法”(TTM)~\citep{Kearns+MN:1999},最初开发用于大型 POMDP 中的高效决策时规划。本文提出了一项理论研究,源于一个令人惊讶的发现:CEM 确实可以被视为 TTM 的应用。这一视角的定性优势在于:(1) 为 CEM 的样本复杂度上界提供了新的简单证明,事实上是在 (2) 比当前文献中普遍采用的更弱的奖励假设下。我们的分析适用于非平稳和平稳 MDP。在定量方面,我们在“错误概率” δ\delta 较小的情形下,获得了 (3) 非平稳和平稳 MDP 下 CEM 样本复杂度上界的改进。此外,我们展示了 (4) 有限时域 MDP 样本复杂度的下界,这确立了在小 δ\delta 情形下我们针对非平稳 MDP 上界的极小极大最优性。

关键词

引用

@article{arxiv.2501.02652,
  title  = {A View of the Certainty-Equivalence Method for PAC RL as an Application of the Trajectory Tree Method},
  author = {Shivaram Kalyanakrishnan and Sheel Shah and Santhosh Kumar Guguloth},
  journal= {arXiv preprint arXiv:2501.02652},
  year   = {2025}
}

备注

15 pages, excluding references and appendices. Total of 29 pages