中文

在 $q^\pi$-可实现 MDP 中用于高效局部规划的置信近似策略迭代

机器学习 2022-10-31 v1 人工智能 机器学习

摘要

我们考虑 γ\gamma-折扣马尔可夫决策过程中的近似动态规划,并将其应用于带有线性值函数近似的近似规划。我们的第一个贡献是近似策略迭代 (API) 的一种新变体,称为置信近似策略迭代 (CAPI),它计算一个确定性平稳策略,其最优误差界随有效时域 HH 与平稳策略动作值函数的最坏情况近似误差 ϵ\epsilon 的乘积线性缩放。相对于 API(其误差随 H2H^2 缩放)的这一改进,代价是内存成本增加 HH 倍。与 Scherrer 和 Lesner [2012] 建议计算非平稳策略以实现类似改进(具有相同内存开销)不同,我们能够坚持使用平稳策略。这允许我们的第二个贡献,即将 CAPI 应用于具有模拟器局部访问和 dd 维线性函数近似的规划。据此,我们设计了一种规划算法,该算法应用 CAPI 在动态演化的状态集上获得一系列精度逐步精炼的策略。该算法在向模拟器发出 O~(dH4/ϵ2)\tilde O(dH^4/\epsilon^2) 次查询后输出一个 O~(dHϵ)\tilde O(\sqrt{d}H\epsilon)-最优策略,同时达到最优精度界和已知最佳查询复杂度界,而文献中较早的算法仅能达到其中之一。除 HH 外,该查询复杂度在所有参数上均被证明是紧的。这些改进以算法及其输出策略的内存和计算成本轻度(多项式级)增加为代价。

关键词

引用

@article{arxiv.2210.15755,
  title  = {Confident Approximate Policy Iteration for Efficient Local Planning in $q^\pi$-realizable MDPs},
  author = {Gellért Weisz and András György and Tadashi Kozuno and Csaba Szepesvári},
  journal= {arXiv preprint arXiv:2210.15755},
  year   = {2022}
}